返回文献精选

AI 评估量表(修订版):教育评估框架

论文精读:Perkins 等(2024)在 arXiv 发表《The AI Assessment Scale revisited》——对年初提出的 AI 评估量表(AIAS)进行系统性修订,以五级框架规定作业中允许使用 AI 的程度(从完全禁止到全面使用),并改进分级描述与实用性,适配不同学科与评估类型,成为教师设计『AI 时代』评估的实用工具。

文献:Perkins, M., Furze, L., Roe, J., & MacVicar, J. (2024). The AI Assessment Scale revisited: A framework for educational assessment. arXiv preprint, arXiv:2412.05381. DOI 10.48550/arXiv.2412.05381。来源:arXiv 预印本(未经同行评审)。

研究问题:生成式 AI 全面进入课堂之后,教师面对的核心难题已经不是“要不要用 AI”,而是**“每一次作业里,允许学生把 AI 用到什么程度”**——完全禁止既不现实、也错失了培养 AI 素养的机会,全面放开则直接威胁学习目标与学术诚信。论文作者在 2024 年初提出了原始的 AI 评估量表(AI Assessment Scale, AIAS),用五个等级刻画“从完全禁止到全面使用”的连续谱;但量表在全世界教育者手中快速传播的同时,也收到了大量反馈与批评:分级描述不够清晰、相邻等级(尤其是“编辑”与“任务完成”)边界难以把握、对学科差异与评估类型的适配不足。论文要回答的核心问题是:如何修订 AIAS,使分级更准确、边界更实用、并能适配不同学科与不同评估类型,从而真正成为教师设计“AI 时代”评估的实用工具?

论证思路:论文以原版 AIAS 自 2024 年初发表以来的大规模应用与反馈为经验基础:先系统梳理教育者在真实课堂中遇到的困难——量表被误读为“越少用 AI 越高尚”的价值等级、三级与四级的边界模糊导致师生无所适从、缺少针对具体学科与评估类型的选用指导等;再据此对量表进行系统性修订:保留五级结构,重写每一级的功能描述使其更精确;明确将量表重新定位为”沟通与透明工具“而非道德评判阶梯——等级高低不意味着好坏,只意味着”这次作业允许 AI 介入到什么程度”;补充量表在不同学科、不同评估类型(形成性/总结性)、不同学习目标下的选用原则与示例;最后给出教师把量表落到作业说明、评分标准与师生沟通中的实施建议。整个论证路径是“实践反馈 → 问题诊断 → 量表修订 → 应用指南”。

原文图1 修订版AI评估量表
图1(原文 Figure 1)修订版 AI 评估量表

一、AIAS 分级框架详解:从禁止到全面使用

AIAS 的核心主张是:评估中的 AI 使用不是“有或无”的二元问题,而是**“程度”问题**。与其用一刀切的“禁止 AI”政策制造灰色地带,不如把允许的程度明确写出来。修订版量表以五个等级刻画这一连续谱(见原文 Figure 1):

  • Level 1 — 无 AI(NO AI):作业在完全无 AI 协助的情况下完成,AI 使用被明确禁止。适用于需要评估学生独立知识、技能与批判思维的场景,例如闭卷考试、课堂限时写作、口试等无法(也不应)借助外部工具的学习目标。
  • Level 2 — AI 辅助构思与组织(AI-ASSISTED IDEA GENERATION AND STRUCTURING):AI 可用于头脑风暴、生成初步想法、梳理结构与列提纲,但最终提交的作业中不得包含 AI 生成的内容。AI 的角色是“思维脚手架”,学生的原创性得到保护,学生需要声明其使用了 AI 辅助构思。
  • Level 3 — AI 辅助编辑(AI-ASSISTED EDITING):AI 可用于编辑学生自己完成的作品——润色语言、改善逻辑与清晰度、检查语法,相当于“升级版拼写检查器”。最终作品实质上是学生自己的,AI 只作为编辑助手介入,学生同样需要作出使用声明。
  • Level 4 — AI 完成任务、人类评估(AI TASK COMPLETION, HUMAN EVALUATION):AI 被允许用于完成任务的特定组成部分——例如生成某段内容、编写代码、处理数据或制作图表——而学生负责评估、批判与整合 AI 的输出,并对最终提交负责。AI 是“执行者”,人是“把关者”;等级名称中的“人类评估”正是强调这一人机分工。
  • Level 5 — 全面使用 AI(FULL AI):AI 在任务全流程中被允许使用,学生借助 AI 完成整个作业,并对 AI 输出进行评价与最终定稿。该等级适用于**“与 AI 协作产出”本身成为学习目标**的评估——例如让学生比较多个 AI 工具的产出、评估 AI 生成内容的质量,此时对 AI 输出的批判性使用正是被考核的能力。

从 Level 1 到 Level 5,AI 的介入程度递增、学生独立完成的比重递减。需要特别强调的是:这五级不是“好→坏”的道德阶梯。Level 1 并不天然“更高尚”,Level 5 也不天然“更宽松放任”——关键取决于被评估的学习目标是什么,这正是修订版反复强调的定位问题。

二、修订版改进了什么

修订并非推倒重来,而是在原版框架基础上的精准修补,主要改进体现在四个方面:

1. 回应大规模实践反馈。 原版量表自 2024 年初发表后迅速被全球院校采用并被翻译成多种语言,作者据此收集了大量来自一线教师的反馈——哪些等级在实际作业中说不清、哪些描述容易误读。修订版以这些真实使用经验为证据基础,而非闭门造车。

2. 更清晰的分级描述与边界。 原版最受诟病的是 Level 3(编辑)与 Level 4(任务完成)的边界:学生用 AI 改写自己的句子算“编辑”,还是算“完成任务”?修订版通过重写功能描述、补充判别标准与示例,让相邻等级的分界更可操作——判断的核心是**“最终作品中的思想与实质内容是否出自学生本人”**:AI 只改进表达是编辑,AI 产出实质内容而学生负责判断与整合则是任务完成。

3. 重新定位:沟通与透明工具,而非价值等级。 这是修订版最重要的理念调整。原版在传播中常被误读为“禁用 AI 才是认真教学”,引发教师抵触与政策僵化。修订版明确:AIAS 不是对“用不用 AI”的道德评判,而是师生之间关于“这次作业允许 AI 介入到哪一步”的清晰契约。等级的选择应当由学习目标驱动——该评估想考核什么能力,就选择相应的等级,甚至可以在同一门课程的不同作业中使用不同等级。

4. 学科与评估类型的适配性。 原版的“通用”表述被批评为难以落到具体课堂。修订版补充了跨学科适配的思路:语言类课程关注原创表达,写作密集型任务可能落在 Level 1–3;编程与数据类任务天然适合 Level 4 的“AI 执行、人类评估”;艺术设计与创意写作可以在构思阶段(Level 2)充分利用 AI;而当课程目标就是培养 AI 素养时,Level 5 反而是恰当选择。量表从“一套标准”变为“一把可调节的刻度尺”。

三、教育评估设计中的应用

修订版把 AIAS 从“分类标签”升级为评估设计工具,其应用逻辑可以概括为三步:

第一步:以学习目标决定等级。 设计任何评估前先问:这道作业究竟要考核学生的什么能力?如果要考核独立写作与论证能力,选择 Level 1 或 Level 3;如果要考核“人机协作下的工程实现能力”,选择 Level 4;如果要考核“批判性评估 AI 输出”的能力,选择 Level 5。等级是学习目标的函数,而不是教师个人好恶的函数。

第二步:区分评估类型,灵活配置。形成性评估(过程性、低利害)中,可以更大胆地开放高等级 AI 使用,让学生在试错中学习与 AI 协作;在总结性评估(高利害、决定成绩)中,则应更谨慎,优先选择能确证学生个人能力的等级。同一次评估还可以分环节混用等级——例如“构思用 Level 2、成稿用 Level 1、后期编辑用 Level 3”,把量表的粒度用足。

第三步:把等级写进作业说明与评分标准。 量表最直接的落地方式,是在每次作业的 Brief 中明确标注“本次作业适用 AIAS Level X”,并说明允许做什么、禁止做什么、需要何种使用声明。这一做法把“老师默许、学生偷用、查出来互相扯皮”的灰色地带,变成白纸黑字的透明契约,也让评分标准的执行更有据可依。

在不同学科中,同一等级的含义可以进一步细化:理科实验报告可能在“数据分析”环节适用 Level 4,文科论文则在“文献梳理”环节适用 Level 2,语言学习则可能全程坚守 Level 1 以保证产出真实反映语言能力。修订版强调的正是这种**“分级框架统一、落地方式弹性”**的设计哲学。

四、对教师的启示

1. 把模糊争论变成可操作的条款。 教师群体围绕 AI 的争论往往陷于“禁止派 vs 放开派”的立场之争。AIAS 提供的是第三条路:不争论立场,只规定程度。教师只需为每次作业选定等级并写进说明,政策层面的争论就转化为具体的教学设计决策。

2. 透明度本身就在保护学术诚信。 大量“AI 作弊”争议源于规则不清——学生不清楚边界,教师难以取证。当允许程度被明确写出并辅以使用声明要求时,违规行为的界定变得清晰,诚信问题从“事后抓包”转向“事前约定”。

3. 为院系与学校层面提供统一语言。 量表的价值在个体教师手中是“作业条款”,在制度层面则是全校统一的 AI 政策语言:不同课程可以选用不同等级,但都在同一套框架内表达,便于教务管理与质量监控,也便于向学生做整体沟通。

4. 保持清醒:量表是工具,不是万能钥匙。 作者也提醒使用者:AIAS 解决的是“允许程度如何规定”的问题,并不自动解决“如何保证学生真正掌握了能力”的问题。教师仍需结合学科规范判断什么是值得评估的,必要时配套口试、答辩、过程记录等手段交叉验证。等级规定得再清楚,评估设计的第一原则仍是——先想清楚要考什么,再决定 AI 用到哪一步

精读笔记

核心论点:评估中的生成式 AI 使用应被理解为“程度问题”而非“有无问题”。修订版 AIAS 以五级框架(无 AI → AI 辅助构思 → AI 辅助编辑 → AI 完成任务、人类评估 → 全面使用 AI)为每次作业规定允许的 AI 介入程度,并将其重新定位为师生之间的沟通与透明工具——等级不是道德阶梯,而是由学习目标驱动的设计决策,帮助教师在不同学科与评估类型中灵活设计“AI 时代”的评估。

方法要点

  • 五级连续谱框架:从 Level 1(完全禁止)到 Level 5(全面使用),核心判别维度是“最终作品中思想与实质内容是否出自学生本人”
  • 基于大规模实践反馈的迭代修订:收集原版量表在全球课堂中的使用经验与批评,据此重写分级描述
  • 边界澄清:重点解决 Level 3(编辑)与 Level 4(任务完成)的模糊地带,以“产出实质内容与否”作为判别标准
  • 学习目标驱动原则:等级选择是学习目标的函数;形成性/总结性评估、学科差异、分环节混用等级均可灵活配置
  • 落地工具化:把等级写进作业 Brief、评分标准与使用声明,使规则透明、可执行

局限与边界

  • 预印本,未经同行评审;量表的有效性依赖教师的正确理解与自觉执行,缺乏实证检验数据
  • 量表规定“允许到什么程度”,但无法独立保证学习结果真实发生——仍需口试、过程证据等手段交叉验证
  • 五级框架是简化模型,真实课堂中的 AI 使用往往更复杂(如不同任务环节使用不同工具),需要教师灵活裁剪
  • 声明机制依赖学生的诚信与教师的监督能力,在规模化教学中执行成本不可忽视

可延伸方向

  • 对量表各等级在不同学科中的实施效果做实证研究,检验其对学生学习结果与学术诚信的影响
  • 开发配套的评估设计工具(如按学科/任务类型推荐等级的决策清单),把框架进一步产品化
  • 探索与自动化的“AI 使用声明”机制结合,降低声明与核查的执行成本
  • 将 AIAS 与 AI 素养教育衔接:把“学生如何报告、反思自己的 AI 使用”本身纳入评分维度
  • 关注量表在非英语国家、非高等教育场景(K-12、职业教育)的迁移适配

原文地址

  • DOI:10.48550/arXiv.2412.05381
  • 来源:arXiv 预印本(arXiv:2412.05381,2024 年 12 月发布)
  • 图表来源:原文 Figure 1(修订版 AI 评估量表)