返回文献精选

LLM 使用与笔记对阅读理解与记忆的影响:中学随机对照实验

论文精读:Kreijkes 等(2026)基于 405 名英格兰中学生的预注册随机对照实验,比较单独笔记、单独 LLM 与笔记+LLM 组合三种学习活动对阅读理解与记忆的影响。

文献:Kreijkes, P., Kewenig, V., Kuvalja, M., Lee, M., Hofman, J. M., Vitello, S., Sellen, A., Rintel, S., Goldstein, D. G., Rothschild, D., Tankelevitch, L., & Oates, T. (2026). Effects of LLM use and note-taking on reading comprehension and memory: A randomised experiment in secondary schools. Computers & Education, 243, 105514. DOI 10.1016/j.compedu.2025.105514。

研究问题:生成式 AI 尤其是大语言模型(LLM)正被学生迅速采用,但“用 LLM 学习”是否真的促进了学习?以往研究多聚焦高等教育与二语写作,而对基础学习环节——阅读理解与记忆保持——的影响严重缺乏证据。论文要回答:与传统的笔记法相比,使用 LLM(单独使用或与笔记结合)是促进还是损害了中学生的阅读理解与记忆?学生的主观体验与客观学习效果是否一致?

论证思路:研究者把 LLM 与传统且证据充分的主动学习活动——笔记法(note-taking)——直接对撞,设计了一个预注册的随机对照实验(含组间与组内设计元素):405 名英格兰中学生各用两种学习活动学习两篇历史文本,三天后完成理解与记忆测试。定量上比较三种条件的客观学习结果,定性上分析学生的提示行为(prompting behaviour)原型与主观偏好,把“学得如何”与“觉得如何”放在同一实验里对照,进而讨论认知参与与动机的张力。

一、研究背景:LLM 进入课堂,证据却存在缺口

LLM 在教育中的普及速度远超证据积累速度。英、美大规模调查均发现相当比例的在校学生使用 ChatGPT 等工具,但既有研究集中于大学阶段与二语写作、编程、物理等科目,且多为“成绩提升”的积极结论——研究者提醒,这些提升可能反映的是 LLM 产出的作品质量,而非学生真实学习的增进

论文抓住两个基础认知环节展开:阅读理解(reading comprehension)与阅读记忆(reading retention)。依据建构-整合模型(Construction-Integration model),理解发生在表面结构、文本基础(textbase)与情境模型(situation model)三个层面;依据加工层次框架(Levels of Processing),编码时加工越深、越精细,信息越容易被提取。笔记法之所以有效,正是因为它强制学习者进行识别要点、转述、概括等主动加工,形成检索线索;而 LLM 的即时答疑、简化解释虽能降低认知负荷、辅助初步理解,也可能诱导浅层加工——学生被动接受答案而不做自我解释与精细加工,从而损害长期保持。两种活动各有其认知与动机逻辑,其真实效果需要实验检验。

二、实验设计:预注册随机对照实验

2.1 样本与学校

实验在英国英格兰的 7 所中学开展,对象为 405 名 14–15 岁(Year 10)学生。学校类型覆盖非选拔性公立学校(3 所)、文法学校(2 所,分男校女校)与独立学校(2 所),分布于三个郡。研究经预注册,遵循英国教育研究协会(BERA)伦理准则,学生与家长均签署知情同意。按预注册排除标准剔除 61 人后(未参加第二轮测试 36 人、未完成学习任务 2 人、未完成全部测试 8 人、测试过短 1 人、两篇文本先验知识差异过大 13 人、作弊 1 人),最终分析样本为 344 人

2.2 组间与组内混合设计

实验采用组间 + 组内混合设计:每个学生都使用两种学习活动学习两篇不同的文本,因此每个学生既是自己的对照(组内),又分属两个不同组合的组(组间)。学生被随机分入两组:

组别 条件一 条件二 最终样本
组 1 LLM(用 LLM 理解和学习文本) 笔记(记笔记理解和学习文本) 184 人(53.5%)
组 2 LLM 笔记+LLM(边用 LLM 边记笔记) 160 人(46.5%)

条件顺序与文本顺序均随机化。选择笔记法而非“只读”作为比较基准,是因为任何超越被动阅读的主动参与通常都会改善学习,若以只读为基准会“人为抬高” LLM 的效果门槛;而笔记法是公认有效的对照。

2.3 学习材料:两篇难度匹配的历史文本

学习材料为两篇说明文,主题均列入英国 GCSE 历史考纲:南非种族隔离(Passage A)与古巴导弹危机(Passage B)。两篇文本改编自 OpenStax 教科书,经大幅调整以保证难度与特征可比:各 4 段、字数几乎相等(386 与 385 词)、平均词长相近、句子数相同(各 26 句)、CEFR 均为 C1 级。

2.4 学习任务流程

学习会话在学校上课时间进行,学生用浏览器访问实验 Web 应用,每场约 35 分钟。每个任务先给出指令(基于主动阅读文献的策略指导)与视频演示,随后学生须在任务页停留 10–15 分钟。LLM 功能由私有部署的 Azure 版 GPT-3.5 turbo 提供(交互限定在 Azure 内部,不回流 OpenAI),学生最多可提问 20 次;系统用不可见的元提示把 LLM 配置为“帮助学生阅读和理解文本”的聊天机器人。在笔记与 LLM 条件下,界面分别只显示记事本或聊天机器人;在组合条件下两者同屏。关键设计是:学生事先不知道会被测试,以避免动机性偏差。

2.5 测试任务与测量(测试会话,三天后)

三天后的测试会话约 30 分钟,覆盖三个由浅入深的结果变量(每篇文本 22 道题):

  • 文字保留(literal retention,满分 20):8 道简答线索回忆题 + 10 道四选一选择题,只测文本表层信息的回忆与再认,无需知识性推理,对应表面结构与文本基础层面;
  • 理解(comprehension,满分 12):3 道开放式问题,需要跨文本多处信息做桥接推理与基于背景知识的推理,对应情境模型层面;
  • 自由回忆(free recall,满分 50):每篇 1 道开放题,请学生写下所有记得的内容,无任何线索提示。

主观题由 3 名教育学博士生独立评分,评分者间信度(ICC)介于 .97–.99,信度极佳。此外还测量了行为参与(LLM 查询次数、笔记字数、任务用时)、学习体验问卷(愉悦度、难度、帮助感、努力程度、偏好与未来使用意向),并从学校获取免费校餐(FSM)资格作为社会经济状况指标。统计分析采用线性混合效应模型(以 LLM 条件为参照),显著性水平 0.05(双尾),效应量用 Cohen’s d。

原文图1 研究设计
图1(原文 Figure 1)研究设计:活动与测量安排

三、定量结果:笔记优于 LLM,组合居中

3.1 学习结果:三个指标的一致图景

线性混合效应模型显示三种条件存在显著差异,方向高度一致:单独笔记表现最好,笔记+LLM 次之,单独用 LLM 得分最低(图3)。

  • 文字保留:笔记相对 LLM 的效应 β = 1.92(p < 0.001,95% CI [1.42, 2.42],d = 0.44);笔记+LLM 相对 LLM 的效应 β = 0.57(p = 0.040,CI [0.03, 1.11])。两者均显著优于单独用 LLM。
  • 理解:笔记 β = 0.95(p < 0.001,CI [0.62, 1.28]);笔记+LLM β = 0.35(p = 0.049,CI [0.00, 0.70])。同样均显著优于单独用 LLM。
  • 自由回忆:笔记 β = 1.02(p = 0.018,CI [0.18, 1.86])显著优于 LLM;但笔记+LLM 与 LLM 无显著差异(β = −0.08,p = 0.855)。作者用非参数检验做了稳健性检验,结论一致。
原文图3 测试成绩分布
图3(原文 Figure 3)各条件与文本的测试成绩分布

小结:“用 LLM”不等于“学得好”——单独用 LLM 是三种条件里学得最差的;笔记的收益覆盖所有测量维度,而笔记+LLM 的收益体现在文字保留与理解,未体现在自由回忆上。

3.2 行为参与:LLM 诱导了更浅的参与

行为数据进一步解释了上述结果。当笔记与 LLM 并存时,学生的提问频率从单独用 LLM 的 9.21 次降至 6.02 次;两种含笔记的条件下,学生均写出约 100 词笔记;但有一个值得警惕的现象——25.63% 的学生大量复制 LLM 输出到笔记中,其中 16.25% 的学生笔记与 LLM 输出几乎完全重合(三元组重叠率超过 90%)。此外,单独用 LLM 时学生的任务用时显著少于含笔记的条件(两组分别少 0.80 与 1.54 分钟),提示笔记带来了更深的任务投入。

3.3 提示行为原型:学生其实“会问”,但问得不够深

研究者对全部 4,929 条提示做了分层编码,识别出四种与任务相关的行为原型:

  1. 寻求额外信息与更深理解(2,265 条):90% 的学生至少用过一次,是最主流的用法,主要是要求详述(1,479 条)与背景知识(514 条),如“今天人们如何受到种族隔离的影响?”;
  2. 信息浓缩(749 条):要求总结或提取要点,如“列出全文五个关键点”、“做一个事件时间线”;
  3. 基础理解(615 条):查定义与简化解释,如“什么是制裁?”、“解释一下共产主义”;
  4. 直接寻求学习与记忆帮助(仅 39 条):让 LLM 出题自测、编记忆术等——尽管学生并未被要求这样做。

另有 760 条为格式/交互类请求(“改成要点式”、“压缩成一句”),501 条(约 10%)为离题内容。值得注意的是,质疑 LLM 可靠性的提示只有 6 条——学生对工具输出几乎不加批判。整体上,学生把 LLM 当作“补充信息源”而非“思维伙伴”,提示行为以信息获取为主,主动的记忆编码策略极少被使用。

四、主观体验:学生更喜欢 LLM,却学得更差

与客观成绩相反,学生的主观体验呈现明显脱节。在组 1 中,学生认为 LLM 比笔记更有帮助、更易用、更有趣,且投入的努力更少;组 2 中,学生认为单独用 LLM 比笔记+LLM 难度更低。也就是说,学得最差的条件恰恰是学生感觉最轻松、最喜欢的条件。但值得肯定的是,测试后两组学生都能准确报告自己在 LLM 条件下表现更差——他们并非完全没有觉察,只是低估了这种差距背后的机制。

活动偏好进一步放大了这种矛盾(原文 Table 1):组 1 中 42.0% 的学生偏好 LLM 而非笔记(偏好笔记的仅 26.9%),理由是“帮助理解”“能回答问题”“简单易用”;偏好笔记的学生则强调“理解”“自己的产出”“帮助记忆”。组 2 中 50.5% 的学生偏好笔记+LLM 组合(仅 16.2% 偏好单独用 LLM),理由是“两全其美”“帮助记忆”“帮助组织”——学生自己已经直觉到组合的价值。

关于未来使用意向:组 1 中 64.4% 的学生表示未来会使用 LLM,55.3% 计划继续记笔记;组 2 中 59.5% 会继续用 LLM,58.5% 计划使用笔记+LLM 组合。学生的行为意图与客观效果之间的错位,为教育引导留下了明确空间。

五、为什么“感觉好”不等于“学得好”:机制解释

作者提出了一个关键的调和框架:LLM 与笔记在学习过程中扮演互补角色

一方面,笔记带来的“合意困难”(desirable difficulties)是学习的关键。记笔记迫使学习者主动识别重要信息、转述与概括,这些认知努力虽不愉悦,却直接对应深加工与记忆巩固;而 LLM 代劳了总结与解释,虽然“感觉高效有趣”,却可能削减了深度学习所需的认知参与。学生偏好 LLM,部分原因是元认知盲区——他们对自己真正需要什么并不总是清楚,倾向于低估笔记这类费力活动在学习中的价值。

另一方面,LLM 的确提供了真实且未被主要分析完全捕捉的益处:它让复杂材料更易理解、降低认知负荷、提供即时澄清与多元视角,还带来动机收益。定性回答显示,学生欣赏 LLM 的“可理解性”,也欣赏笔记的“深度参与与记忆”。因此,问题不在于“用不用 LLM”,而在于如何设计使用方式,使 LLM 的即时理解优势不取代笔记的深度加工优势

六、对 AI 时代作业与教学设计的三点启示

  1. 把 LLM 使用与笔记在时间上分离:先独立阅读文本,再用 LLM 澄清与探索,最后在不能复制粘贴 LLM 输出的前提下独立记笔记——这能直接阻断本研究中观察到的“复制捷径”,迫使学生在自己的话语中综合与内化信息。
  2. 训练学生“主动地”用 LLM:引导学生像问老师一样提出针对性问题、批判性地核对信息,而不是被动消费自动总结;把 LLM 定位为“思维伙伴”而非答案机器,同时培养一般性的元认知技能。
  3. 利用 LLM 交互数据了解学情:学生问了什么、卡在哪里,本身就是宝贵的形成性评估信息,可在隐私保护前提下反馈给教师,用于个性化指导。

精读笔记

核心论点:在中学真实课堂情境中,主动笔记(单独或与 LLM 结合)显著优于只依赖 LLM——单独用 LLM 是三种条件里学得最差的,但它提供理解辅助与动机收益。LLM 与传统笔记不是替代关系而是互补关系,“LLM + 主动笔记”是最优组合;同时学生的主观偏好与客观学习效果明显脱节,教育者必须介入引导。

方法要点

  • 预注册随机对照实验,组间+组内混合设计(每人学习两篇文本、体验两种条件),345 级别的中学样本,证据等级在 LLM 教育研究中属最高一档
  • 结果测量分层精细:文字保留(表层)→ 理解(深层推理)→ 自由回忆(无提示提取),覆盖记忆与理解的多个层面;评分者信度 .97–.99
  • 行为数据(查询次数、笔记字数、复制粘贴率、用时)+ 4,929 条提示的定性编码 + 主观问卷三者互证,定量定性结合完整
  • 以笔记法而非“只读”为对照,避免高估 LLM 效果,设计上很干净

局限与边界

  • 无“仅阅读”基线条件,无法评估 LLM 相对被动阅读的绝对效果
  • 单次、孤立的学习活动(非课程情境下的反复使用),3 天记忆窗口偏短,长期效应未知
  • 文本难度适配中学生,对超出学生能力的高难文本,LLM 的收益可能被低估
  • 学生可能因对 LLM 不熟悉而未充分发挥其潜力(对笔记更熟悉),对 LLM 条件略不利
  • 互动效应的探索(性别、社会经济地位、学校类型)因样本量未达计划而放弃

可延伸方向

  • 检验“先读→用 LLM→再独立笔记”的分离式设计是否真能阻断复制捷径、提升记忆
  • 把 LLM 配置为主动学习策略的“教练”(出题自测、生成问题、批判性核对),测试其能否提升元认知参与
  • 更长时间跨度的纵向研究:反复使用 LLM 对阅读技能、独立问题解决与元认知的长期影响
  • 针对高难文本与不同学科(STEM、人文)验证 LLM 的收益边界;对复制粘贴行为做实时检测与干预

原文地址