返回黑/白板前的冥想

从「特洛伊木马」到「AI 攻不破的考试」:Nature 采访的七类测评改革

精读 Nature 职业版块(Career Feature,2026-09-01)对全球高校教师的采访:当 94% 的英国本科生承认在评分作业中使用生成式 AI,教师们的应对已从「检测作弊」转向重新设计评价本身——让 AI 成为被批判的对象、把评价挪回可观察的现场(课堂手写、口头答辩)、用交互日志与修订历史留下过程。本文整理七类做法与受访者的原话,并归纳其背后的三条逻辑。

Nature 该文插图:一半是学位帽、一半是电路的毕业生侧影

整理说明:本文整理自 Nature 职业版块(Career Feature)2026-09-01 报道《From Trojan horses to AI-proof exams: how professors are tackling students’ AI use》(作者 Katarina Zimmer,柏林自由撰稿人),保留受访教师的原话引述(中文为本站翻译,关键处保留英文原词)。文首插图为该文配图(Illustration: Claire Welsh/Nature/Adapted from Getty);两张示意图为本站据报道内容自制。说明:原文后半部分需登录阅读,本文整理的是公开可见的开篇数据与七类做法。

大型语言模型在学生中的使用正在快速普及。Nature 开篇引用了两组数字:HEPI 2026 年对 1,054 名英国本科生的调查显示,约 94% 的学生表示会用生成式 AI 协助完成被评分的作业12% 直接把 AI 生成的文本插入课程作业;一项 2026 年 5 月发表、基于美国 20 所大学逾 95,000 名学生调查数据的研究则估计,9% 的学生在明知违规的情况下在作业中使用了 AI。

两项调查数据:94%/12% 与 9%
Nature 该文开篇引用的两组数据,以及两个数字的落差方向:用 AI 已是常态,直接粘贴仍是少数(据原文所引 HEPI 与 Science 文献整理,本站自制示意)

与此同时,教师们在带回家的作业和线上考试中看到越来越多的可疑迹象——从编造的参考文献到典型的 AI 标点风格。麻省理工学院教授语言学与传播学的 Nikita Bezrukov 回忆,有一段时间收到的文章里「50% 的参考文献在现实中并不存在」。但另一面同样重要:许多教师越来越承认 AI 在学生教育与未来职业中的益处与不可避免性,也认为需要教年轻人明智地使用这项技术。

「我认为现在没有人有『正确』答案,」杜兰大学计算机科学家 Nicholas Mattei 说,「事情变化得相当快。

一、七类做法

高校应对学生使用 AI 的七类做法总览
Nature 采访归纳的七类做法与代表性受访者(据原文七节整理,本站自制示意)

1. AI 生成式作业:把 AI 本身变成作业对象

「在我的技术史课上,学生要自己找到史料,用三个 LLM 分别做摘要,并批判模型的说法;然后制作信息图、写一篇文章——这篇允许用 AI。如果他们发现信息图没有准确反映史料、或者 LLM 编造了参考文献,可以加分。目的是促使他们对 LLM 的输出做更多批判性反思。」——Nicholas Mattei,杜兰大学

「以前我让学生写一篇关于亚当·斯密 1776 年《国富论》的论文,现在我让他们用充当市场交易者的 AI agent 搭建这套理论的虚拟呈现,再一起探讨各种情境——比如人们变得不可信时会发生什么。学生分析 agent 产生的对话记录并据此写作。学生是否让 AI 一步到位地做完,很容易看出来:它常常是编造,而不是引用对话记录里的内容。」——Daniel Silver,多伦多大学士嘉堡分校

2. 允许使用:把 AI 当作环境的一部分

「我的网页开发课程考试开卷、开网——AI 本来就是互联网的一部分。但我评的是一项 AI 并不具备的技能:如何构建良好、可持续的网页应用。我出的是本质上有多种答案的开放题,比如『这个网站为什么不能用?』『这个网站为什么慢?』把这些问题丢给聊天机器人,它们会不作任何方法论证就给出答案,而且未必准确。」——Ruben Verborgh,根特大学

「我无法确信学生没用 AI,所以默认我评的是『学生+AI』这个小组。但我布置的任务不是只靠 ChatGPT 就能完成的:我给出对神经活动数据做某类分析的截图,让学生写一段叙述。如果学生把作业提示词直接粘进聊天机器人、原样照抄输出,答案往往与截图里发生的事情毫无关系——一眼就能看出来。」——Etienne Roesch,雷丁大学

3. 要求留痕:看过程,而不只看成品

「对于在研究和学术写作中使用 AI 的学生——尤其是博士生——我要求他们提交与 AI 工具的原始交互日志。目的不是监视学生,而是帮助我判断:他们是否深度参与了智识工作、通过 AI 扩展了哪些知识、工具是被用来支持思考还是替代思考。」——Shen Yanjun,长安大学(生态与工程地质)

「学生不用交 PDF,而要用带修订历史的软件(如 Google Docs)完成作业。这样我能看到早期版本,从而判断他们在过程中是否、以及如何使用 AI。我不介意英语非母语的学生用它改语法或润色文字,但用 AI 整体生成文本是禁止的。」——Nikita Bezrukov,麻省理工学院

4. 减少带回家作业:把评价挪回现场

「我教的一门课,把作业改得很少在家写。以前让学生做两份信息图,看到大量 AI 生成材料后,我改成课堂上做一个关于高等教育政策或项目的 pitch,之后再做一次完整演示。即兴演讲和课堂写作也比以前多了。」——Kristina Ruiz-Mesa,加州州立大学洛杉矶分校

「虽然此前我已放弃传统考试,但今年春天我回到了书面课堂考试,并且一学期让学生三次在课堂上写文章。他们可以带笔记和书,但必须在答题册上写,不许用手机和笔记本电脑。」——Jennifer Sessions,弗吉尼亚大学(历史学)

5. 不计分作业:用评分杠杆换真实学习

「数据分析的带回家作业我只记通过与不通过。学生用 AI 生成代码以省出时间做更有意思的分析,这没有错;但如果用 AI 替代自己的思考,他们可能通过课程作业,却很可能在只允许基础计算器的期末考试中吃力。取消打分,我们是在鼓励真正的学习——今年考出满分的学生人数是我们历来最多的。」——Natalia Sidarova,埃因霍温理工大学

「我们系允许带回家作业使用 AI,但一些同事降低了这类作业的权重,改在离线小测中评估所学技能。有些小测题与作业直接相关,学生如果自己做了作业,答对概率就更高。我们还用排行榜把课程作业游戏化。」——Mausam,印度理工学院德里分校

6. 转向口头答辩:要求为每一行负责

「我让学生写大量 Python 代码来解释化学数据。分数的 70% 看代码能否正常运行,剩下 30% 取决于一次简短的一对一口头问答:我问他们某几行代码是怎么工作的。我不在乎这行是不是 ChatGPT 告诉他们的——他们必须理解并为每一行负责。」——Gianmarc Grazioli,圣何塞州立大学

「我布置的第一份课程作业中,书面部分现在只占最终成绩很小的比例;占比最大的是之后与我面对面讨论并进一步发展材料的对话。之后的考试中,如果学生不能在讨论中证明作者身份与掌握程度,成绩上限为 C。」——Thea Goldring,普林斯顿大学写作项目

7. AI 检测工具:作为多项线索之一

「对于网课学生提交的作业,我使用学校提供的 AI 检测工具,它可以为我的直觉判断提供一定程度的佐证。另外的线索是编造的参考文献,或者学生的初稿与终稿差异过大。我会综合几条信息作出合理判断。」——Jacqueline Evans,佛罗里达国际大学(心理学)

二、这七类做法背后的三条逻辑

把七类做法放在一起看,会发现它们解决的不是同一个问题,而是各自咬了「AI 参与作业」这只手上的一根手指:

  1. 把 AI 变成被评价的对象(第 1、2、5 类)。 评价对象从「成品」转向「辨析与驾驭 AI 输出的能力」——学生要能指出模型错在哪、幻觉在哪,甚至因为发现错误而加分。这类做法承认 AI 会在场,于是把「会不会用」变成考核内容本身。
  2. 把评价挪回可观察的现场(第 4、6 类)。 课堂手写、一对一口头答辩,用场景设计解决「谁写的」问题,而不是靠事后侦查。普林斯顿的「不能证明作者身份则上限 C」是这一类里最直接的制度表达:它不追问过程,而是要求当场兑现理解。
  3. 用过程留痕替代事后侦查(第 3、7 类)。 交互日志、修订历史把「用没用 AI、用在哪一步」变成可读的证据;检测工具则被明确降格为线索之一,与幻觉文献、初稿终稿差异并列。

一个共同的方向:从「检测学生是否用了 AI」转向「设计 AI 替代不了的环节」。原文标题的两端恰好是这条光谱的两头——「AI 攻不破的考试」与把隐藏提示悄悄塞进作业的「特洛伊木马」(后者即用埋设的指令来识别「是否真的读了题」)。

但也别忽略两类做法的代价:口头答辩与课堂手写提高了可信度,却几乎无法规模化,对班级规模大的课程尤其如此;而不计分作业降低了作弊动机,前提是学生真的在意形成性反馈——Sidarova 说今年满分人数最多,但这能否在别的课程复现,仍是开放问题。Mattei 的那句「没有人有正确答案」,放在这里是准确的。

写在后面

这篇采访最值得带走的一点,是把问题从道德判断换成了设计问题

如果 94% 的本科生在评分作业里使用生成式 AI,「禁止」就已经不是一个可执行的默认前提——它只会让教师和学生共同进入一种心照不宣的模糊状态。真正要回答的是:这门课的评价中,哪一部分必须由人当场完成?学生能不能解释自己交上来的每一步? 七类做法其实都是在为这两个问题给出可操作的答案。

如果只挑一条马上能用的,我会选 Grazioli 的分数拆分:作品能跑占 70%,你能否解释它占 30%。它不需要额外设备,不需要检测工具,也不预设学生没用 AI——它只是把「理解」重新变成了评分表上的一项。


来源:Nature · From Trojan horses to AI-proof exams: how professors are tackling students’ AI use(Career Feature,2026-09-01,Katarina Zimmer;doi: 10.1038/d41586-026-02370-2)|该文所引数据:HEPI《Student Generative AI Survey 2026》|Chirikov, Smirnov & Kizilcec, Science 392, 818–820 (2026)