返回文献精选

OECD 数字教育展望 2026:探索生成式 AI 在教育中的有效应用

文献精读:OECD 旗舰报告,综合证据与专家洞见,回答生成式 AI 在哪些场景真正改善学习、如何引导其负责任采用。

文献:OECD (2026), OECD Digital Education Outlook 2026: Exploring Effective Uses of Generative AI in Education, OECD Publishing, Paris. 247 页,三大板块、13 章。

研究问题:生成式人工智能(GenAI)正在快速进入全球教育系统,引发对个性化学习、教学改进和系统管理效率的期待。报告要回答:GenAI 在哪些场景真的能改善学习结果?哪些证据支持或反对这些期待?教育利益相关者如何引导其有效且负责任的采用?

论证思路:报告综合最佳可得实证研究、设计实验与专家洞见,按“增强学生学习 → 增强教师表现 → 改善系统管理”三个层面组织证据,并给出政策含义。核心判断是:通用 GenAI 若作为捷径使用会损害学习,必须带有教学目的使用,或重新设计为专门的教育 GenAI 工具。

关键发现一:GenAI 改善学习的条件

证据的两种结果

报告指出,关于 GenAI 对学习的影响,证据呈现两种结果:有些研究发现学生的输出质量学习都提升;另一些则没有,尤其是当工具直接给出答案、而非支持真实学习过程时。

关键机制是元认知参与(metacognitive engagement)——把答案转化为理解的心理过程和努力。当学生过度依赖 GenAI 时,元认知参与下降,导致任务表现与实际学习之间的错位(misalignment between task performance and genuine learning)。

土耳其实地实验:短期提升、长期受损

报告引用的一个关键证据是土耳其的实地实验:学生接触 GPT-4 后短期表现提升——标准界面下提升 48%,支持学习的辅导版本下提升 127%;但当访问权限移除后,学生表现比基线差 17%

“students performed 17% worse once access was removed, showing that generative AI can undermine learning unless explicitly designed to support skill acquisition.”

——除非明确设计为支持技能习得,否则 GenAI 可能损害学习。

正面证据:配置为教学工具的 GenAI

  • 哈佛物理课随机对照实验:同一套“主动学习”教学原则,通过线上 GenAI 辅导 vs 线下面对面授课。学生用 AI 辅导在更短时间内学到更多,且更投入、更有动机(Kestin et al., 2025)。
  • 中国阅读实验:配置为实现基于问题的学习(PBL)的 GenAI 工具,阅读成绩和动机优于传统非个性化方法(Huang et al., 2025)。
  • 协作学习综述(Strauß & Rummel, 2026):大多数研究不使用通用 LLM,而是配置模型控制其行为、赋予特定角色——基于此前计算机辅助协作学习研究的良好实践。

共同模式:GenAI 改善学习的前提是——工具被配置为教育用途、植根于专家教学实践和学习科学,而非通用聊天机器人。

关键发现二:反馈与评估

GenAI 生成反馈

报告(Gašević & Yan, 2026 综述)认为,GenAI 能支持教师给出更好的反馈,但不能替代人类反馈。证据对比:

  • AI 生成的反馈在质量上与人类反馈相当(如 GPT-4 反馈的学习增益与人类教师相当,Kaliisa et al. 元分析)
  • GenAI 反馈更可读、更润色;人类反馈更简洁;GenAI 在过程与自我调节维度上略优
  • 但人类与 GenAI 对学生作品优缺点的判断一致性低

结论:反馈必须被认真对待并采取行动才有效,这取决于质量、可信度与动机维度——纯委托给 GenAI 并不必然成立。

高利害标准化评估

GenAI 可大规模生成试题、设计更真实的任务(模拟真实交流的交互式写作与口语任务)。教师与 AI 协作可获得显著生产率提升。

关键发现三:教师与 AI 协作

Teacher–AI Teaming 框架

报告提出教师与 AI 协同工作(teaming)的模型:教师与 AI 互相批判、互相完善对方输出,迭代过程提供改进教学质量的最大潜力,同时保留专业判断。这区别于“替代”(replacement)与“互补”(complementarity)两种范式。

现成工具的局限与专门化需求

  • 大多数现成聊天机器人很少与课程对齐(rarely align with curricula)
  • 主张构建专门的教育 GenAI 系统,与教师和学生共同创建(co-created),让教育者控制机器行为与学生交互——例如教师可设置工具的“幻觉”水平、反馈学生 GenAI 交互

AI 教学助手证据

高等教育中已有 AI 教学助手(如 JeepyTA 平台案例)。学生评价某工具在清晰度、准确性和专业性上相当于人类助教,但在动机和发展性指导上较弱

关键发现四:系统与制度管理

  • GenAI 正在重塑机构行政任务:嵌入模型可映射课程与项目间的等价关系,使招生、职业指导和课程分析更快更准;大规模试点显示高预测准确率与效率增益,但人机协作仍是必须(chapter 11)
  • GenAI 对教育研究的影响:在自然科学中加速从假设生成到实验设计的全过程(chapter 13)

图:GenAI 采用率

图1.1 各国互联网用户使用 ChatGPT 的比例(2024 vs 2025)
图1.1 各国互联网用户使用 ChatGPT 的比例(2024 vs 2025),反映 GenAI 工具的全球采用趋势(原文)

精读笔记

核心论点:GenAI 有潜力规模化个性化学习支持、提升反馈质量、自动化部分评估——但“便利”有代价。关键是教学目的:带教学目的使用通用工具,或重新设计为专门的教育工具;教师应鼓励学生能动性、强调过程(如何思考与学习)而非输出

方法要点

  • 以证据综合为方法,区分“任务表现提升”与“真实学习增益”两类结果
  • 用实地实验(土耳其)、随机对照试验(哈佛物理)等高质量证据支持判断
  • 按学生/教师/系统三层组织,便于决策者按需取用

局限与边界

  • 证据仍在快速演进,许多方向“证据有限、统计功效不足”
  • 技术迭代快(如新模型 Deepseek、Perplexity 2023 年以来市场份额增长),结论需随技术更新
  • 报告为政策导向综述,各章证据强度不一,部分为原型与设计实验

可延伸方向:追踪 GenAI 辅导系统在中文教育场景的长期效果;研究教师与 AI 协作(teaming)在高校的具体实现;将“元认知参与”作为调节变量考察 GenAI 使用方式的影响;比较专门教育工具与通用工具在课程对齐上的差异。

原文地址