AI 评分机制 详解
我们认为您有权了解作文评分的每一个细节。本页将说明我们的评分方法、AI 评估的内容、已知的局限性,以及我们持续改进的方式。
概述
当您在 993 道练习题中的任一题提交作文后,AI 模型将按照与 IELTS 考官相同的 4 项标准进行评分。您将获得每项标准的分段估计、综合分段,以及 1 条提升分数的具体建议。
免费评分使用 DeepSeek,这是一个针对结构化评估进行优化的大语言模型。付费用户可额外获得 Gemini 的深度分析,包括段落级反馈、句子改写和范文。
4 项评分标准
每篇 IELTS Writing Task 2 作文均按 4 项标准评分,各标准权重相同。AI 独立评估每项标准,然后取平均值并四舍五入到最近的 0.5,得出综合分段。
Task Response(TA)
作文是否回应了题目的所有部分?是否全篇保持了明确的立场?观点是否得到了展开并有实例支撑?
Coherence and Cohesion(CC)
作文的组织是否有逻辑?句子和段落之间的衔接是否自然流畅?连接词的使用是否恰当而非机械?
Lexical Resource(LR)
作者是否使用了足够丰富的词汇?用词是否精准自然,并包含一些不太常见的词汇?拼写错误是否很少?
Grammatical Range and Accuracy(GR)
作文是否混合使用了简单和复杂的句型结构?语法错误是否少到不影响交流?
校准机制
AI 根据 British Council、IDP 和剑桥发布的官方 IELTS 分段描述进行校准。我们使用以下明确的评分锚点:
Band 7.0 及以上:立场明确、组织良好、词汇丰富、语法掌控力强。对于 7.0 以上的分数,AI 必须从作文中引用依据。
Band 6.0–6.5:回应所有部分、逻辑连贯、词汇基本充足(有一些错误)、简单句和复杂句混合使用。
Band 5.0–5.5:部分回应题目、词汇有限、语法结构有限。
Band 5.0 以下:所有标准均存在重大不足的最低限度回应。
分数仅以 0.5 分段为单位给出,与真实考试的评分单位完全一致。
评分规则
以下规则确保 AI 评分的一致性:
- 1
低于 250 词的作文仅在 Task Response 项扣分(减 1.0 分段),与真实考试的扣分标准一致。
- 2
包含明确立场、两个有论据支撑的主体段落和一些复杂句式的作文至少获得 6.0 分。当这些要素存在时,AI 不会给出更低的分数。
- 3
综合分段为 4 项标准的算术平均值,四舍五入至最近的 0.5。
免费版与付费版对比
两个版本使用相同的评分标准,区别在于反馈深度:
免费版
- ✓全部 4 项标准的分段评分
- ✓综合分段估计
- ✓1 条具体改进建议
- ✓适用于全部 993 道练习题 — 无需注册
付费版
- ✓包含免费版全部功能,此外还有:
- ✓段落级优势与不足分析(附作文引用)
- ✓具体的修改前后句子对比
- ✓同一题目的 Band 9 范文
- ✓按提分效果排序的 3 大学习优先事项
已知局限性
我们对 AI 评分的能力边界保持透明:
非官方 IELTS 成绩
我们的分数为估计值。只有官方 IELTS 考试中心才能给出正式分段成绩。请将我们的估分用于练习和进度跟踪。
无法评估手写
AI 读取的是打字文本。在纸笔考试中,难以辨认的手写可能导致扣分,但 AI 无法模拟这一情况。
精度范围
在内部测试中,AI 评分通常与人类考官对同一篇作文的评分相差 0.5 分段以内。偶尔差距可达 1.0 分段。
暂不支持 Writing Task 1
当前评分系统仅针对 Writing Task 2 作文进行校准。Writing Task 1(图表、书信)使用不同的评分标准,尚未支持。
偏题作文
如果作文与题目完全无关,AI 仍可能给出分数。人类考官在这种情况下很可能会给出远低于此的分数。
为什么公开此页面
大多数 AI 评分工具都是黑箱。提交作文、获得分数,却不知道分数是如何计算的。我们认为这是不对的。
当您理解评分机制后,就能更有针对性地学习 — 集中攻克拉低综合分段的那项标准。这正是我们平台的核心价值所在。
Read the current publication standard, withdrawn-claim policy, and public activity data definitions on our Research and Data Methodology page.
持续改进
我们定期将 AI 输出与人工评分的作文进行对比,检验评分准确性。当发现 AI 存在评分偏高或偏低的规律时,我们会更新评分提示词并重新测试。
如果您认为作文评分不合理,请发送邮件告知我们。每一条反馈都有助于改进校准。
对评分有疑问?
如果您对某篇作文的评分有疑问,或希望报告不准确的结果,请联系我们。
联系我们