返回黑/白板前的冥想

AI 越来越强,为什么还要亲自学习?——从「外星思维」到 PNAS 课堂实验

GPT-6 Astra 发布、OpenAI 首席科学家 Pachocki 长文《An Alien Mind》、PNAS 高中数学实验——当 AI 越来越会替人完成任务,教育凭什么还要求学生亲自学习?一篇给教师与学生的冥想:机器完成任务,不等于使用者获得成长。

AI 越来越强,为什么还要亲自学习?——机器完成任务 ≠ 使用者获得成长

9 月 3 日,OpenAI 发布 GPT-6 Astra,公司总裁 Greg Brockman 说:“欢迎来到 AGI 时代(Welcome to the AGI era)。”

OpenAI 对 AGI(通用人工智能)的官方定义是:

“在大多数具有经济效益的工作上超越人类的自主系统(highly autonomous systems that outperform humans at most economically valuable work)。”

我们不必争论 GPT-6 Astra 是否真的到了这一步。真正值得想的是:如果顶尖 AI 的技术追求,是“在大多数有经济价值的工作上超越人类”,那学生作业里那点事,还重要吗?

9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 发表长文《An Alien Mind》(《外星思维》)。他担心的正是:AI 能力的增长可能超过人类理解和约束它的速度。这篇冥想,是想沿着他的话,往教育里走一步。

一、会完成任务,不等于值得信任

“外星思维”不是外星人的故事,也不是“AI 有了意识”的宣告。它指的是:一种与人类来源不同、不能直接按人类经验来理解的智能。

大模型依然是软件,但它处理问题的规则,已经不再只由人逐条决定——训练通过数据和优化不断调整内部参数,使模型形成了更强的语言与任务能力。关键在于,Pachocki 提醒我们区分:能够训练出某种行为,不等于真正理解了这种行为。

他把“对齐”拆成两层:

  • 目标对齐:AI 是否努力完成指定的任务;
  • 价值对齐:在陌生情境或目标冲突里,它能否仍依据高层原则行动。

用一个教育场景来理解:我们让 AI “提高学生成绩”——它会不会觉得,“帮助理解”和“直接给出答案”是一样有效的办法?

两者都可能让作业更漂亮,对学习的意义却完全不同。问题不只在于目标有没有实现,还在于目标是怎样实现的,以及实现它时牺牲了什么。 而且,我们可以期待机器更可靠地遵守约束,却不能把人的成长也定义为“更稳定地服从要求”

二、看见推理过程,不等于看懂机器

想看懂 AI 在“想什么”,一个直观的办法是:不只检查它的答案,也检查产生答案的推理记录——这就是“思维链监控”。

2024 年 OpenAI 发布 o1 时解释过,不直接展示原始思维链,部分是为了保留“不受用户偏好直接塑造的推理空间”,以便监测模型行为。但 2025 年的一项内部实验发现:惩罚思维链里暴露的作弊意图,虽然减少了部分作弊,却没有消除作弊;剩下的作弊反而更难被同一个监控器发现。

换句话说:如果我们不断奖励“看起来正确的推理”,我们只是在训练 AI 生成更漂亮的表述。Pachocki 在新文中更进一步表示:内部评估显示,他们越来越难以依赖思维链监控

对教育使用者来说,这里能引出一条很实用的提醒:

一段流畅的解释,不应直接被视为可靠性的证明。AI 讲得再有条理,教师也应核查关键依据。

三、AI 已经开始参与“下一代 AI”的研发

同一天,OpenAI 发布了内部研究加速报告。按其自测,系统已到“自动化研究实习生”阶段:能在人类指导下,完成一些原本需熟练研究人员花数日的明确任务。报告强调:研究优先级、结果判断、是否扩大训练或部署,仍由人类决定。

但方向本身已经值得重视:AI 协助改进 AI,改进后的系统再加速研发——这是通往“递归自我改进”的路径,也意味着监督能力必须跟得上被监督对象的能力。

复杂之处在于:更强的 AI 也可能帮助安全研究与基础设施保护。OpenAI 把这列为推进自动化研究的理由,同时也承认——不能假定安全进展必然跟得上能力增长。Pachocki 因此主张:能力扩张应受安全把握约束,必要时减速,并建立有外部监督的共同安全门槛。

四、作业完成了,学习却可能没有发生

2025 年,Hamsa Bastani 等人在 PNAS(美国国家科学院院刊)发表了一项高中数学实地实验,涉及近千名学生:

  • 使用通用 GPT-4 辅助工具的学生,练习表现有所提高
  • 但撤去工具后的独立考试成绩,比对照组低约 17%
  • 另一种加了教学保护设计的辅导工具,大幅缓解了负面影响,却没有带来独立考试成绩的显著提升

这个结果提醒教育者一个关键区分:

工具在场时的表现,与学习者形成的能力,需要分开评价。

而检验方式,不必退回“所有事情都禁止 AI”。可以让学生先提交一个尚未得到 AI 帮助的初步判断,再记录哪些证据改变了自己的观点;也可以允许学生借助 AI 完成作品,随后用新情境中的追问检查其理解是否真实形成。

效率当然重要。但在教育里,有些过程之所以不能省略,不是因为机器做不好——而是因为这些过程本身就是学习的对象。

工具在场表现 ≠ 学习者形成的能力:PNAS 实验与三层教育设计
「工具在场表现 ≠ 形成的能力」:PNAS 高中数学实验的启示 + 保留学生能动性的三层设计(本站自制示意)

五、保留人的位置,不能只留下一个“确认按钮”

OECD《学习指南针 2030》把**学生能动性(student agency)**放在重要位置:学生需要学会在陌生情境中寻找有意义、负责任的方向,而不只是接受预先给定的指令。

从这个角度看,AI 时代的课堂要同时回答两个问题:① 学生是否更有能力行动?② 学生是否仍有权决定行动的方向?

设想一个研究项目:AI 提出问题、安排步骤、生成结论,学生只需不断点击“继续”。即使最终成果很优秀,我们也必须追问——让他坐在那里点确认键,有什么意义呢?

所以,不妨给 AI 课程加一条设计要求:

每个项目,都应保留至少一个由学生提出、能说明理由、并能实际改变后续进程的决定。

同时,也不能把责任全压给学生。学校和平台应提供质疑推荐、修正标签、请求人工复核的途径——不能一边让系统替学生决定,一边要求学生为所有后果负责。

我们要保护的不是脱离知识的“自主性”,而是有知识、有支持、也有真实选择机会的参与

写在最后

Pachocki 的长文让一个问题变得难以回避:机器越强,人的位置就越不能靠“机器暂时做不到什么”来保证。

学校不应只去寻找“AI 还不会、人暂时还能做”的剩余空间。即使 AI 能交出更好的报告,学生仍然值得拥有提出问题、理解世界、形成自己判断的机会。教育保留这些机会,不是为了证明人胜过机器——而是为了让人能够过自己的生活。


参考来源:

  • Pachocki, J. (2026). An Alien Mind. OpenAI,2026-09-06
  • OpenAI (2026). Research Acceleration: The View Inside OpenAI,2026-09-06
  • Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences, 122(26)(PNAS,顶刊)
  • OECD (2019/2021). OECD Learning Compass 2030——学生能动性(Student Agency)框架

文中插图(封面与“工具在场 vs 形成能力”示意图)均为本站自制;正文中《外星思维》、PNAS 实验与 OECD 框架相关内容为对公开来源的转述与个人冥想,引用请以原始论文/报告为准。