苏格拉底式 AI 对话智能体:让提问策略真正改善学业表现与反思性思维
论文精读:Xi, Zhang & Wang(2026)用 94 名大学生的随机对照实验证明,整合苏格拉底提问策略的 LLM 对话智能体(S-ICA)显著提升学业成绩与反思性思维,认知网络分析(ENA)揭示其激活更多高阶认知路径。
文献:Xi, L., Zhang, Y., & Wang, Q. (2026). Investigating the effects of an LLM-based Socratic conversational agent on students’ academic performance and reflective thinking in higher education. Computers & Education, 241, 105494.
研究问题:大语言模型(LLM)驱动的对话式智能体正在大规模进入课堂,但多数应用只是把 AI 当作“答案生成器”——学生提问、AI 作答,交互停留在信息检索层面。论文追问一个更本质的问题:如果对话式智能体不再是直接给出答案,而是以苏格拉底式提问引导学习者自己建构答案,能否同时提升学业成绩与反思性思维? 更进一步,这种效果能否在“反思(reflection)“与”批判性反思(critical reflection)“这两个深层认知维度上被观察到?
论证思路:论文开发了一个苏格拉底式智能对话代理(Socratic Interactive Conversational Agent, S-ICA),把苏格拉底提问策略(追问、反诘、类比、揭示矛盾等)与 LLM 的语义生成机制整合进对话流程,使智能体在对话中“以问代答”,持续把学习者的思考推向更深处。为了隔离“苏格拉底策略”本身的贡献,研究者设置了对照系统 nS-ICA——同样基于 LLM、同样能对话,但直接给出答案而不使用苏格拉底式提问。通过随机分组实验,对比两组学生在概念知识测验(学业表现)与反思性思维量表上的前后测差异,再用**认知网络分析(Epistemic Network Analysis, ENA)**刻画两组对话中的认知路径结构,从行为数据层面解释成绩差异的来源。
一、为什么是苏格拉底式提问
苏格拉底式教学法的核心假设:知识不能直接“传递”,而要靠学习者自己“接生”。教师不给出答案,而是通过连续追问暴露学生的前概念、矛盾与盲区,迫使其重构理解。这一传统在面对面教学中已被反复验证,但在 AI 对话智能体中长期缺失——原因是技术约束:早期聊天机器人只能基于模板或检索匹配预设问题,无法针对学生回答的语义内容动态生成追问。
LLM 的语义生成能力改变了这一约束。论文提出的 S-ICA 采用两阶段机制:
- 苏格拉底提问策略层:内置多类苏格拉底式对话策略(如澄清性追问“你为什么这么认为?”、反例反诘“如果……会怎样?”、类比迁移“这与我们学过的哪个概念相似?”、矛盾揭示“你刚才的说法与之前的回答一致吗?”);
- 语义生成层:利用 LLM 对学生的实时回答做语义理解,动态选择并生成贴合当前回答的追问,使对话保持“追问—回应—再追问”的苏格拉底循环。
对照系统 nS-ICA 在架构上完全一致,唯一差异是:面对同一学生回答,nS-ICA 直接生成解释性答案,而非提出问题。这保证了实验对比的是“提问策略”这一单一变量的效应。
二、研究设计与方法
样本:94 名中国高校大学生,随机分配到实验组(EG,n=48,使用 S-ICA)与对照组(CG,n=46,使用 nS-ICA)。随机分配保证了两组在前测上的可比性(前测均值几乎持平,见下文 Table 2)。
设计:前后测对照实验。
- 前测:概念知识测验 + 反思性思维量表;
- 干预:两组分别使用 S-ICA 与 nS-ICA 完成相同主题的学习对话;
- 后测:同一套概念知识测验与反思性思维量表;
- 过程数据:完整记录两组与智能体的全部对话文本,用于认知网络分析(ENA)。
分析:学业表现用线性混合模型(LMM)检验时间与条件的主效应及交互,再以 ANCOVA 校正前测差异后比较组间效应;反思性思维按“反思”与“批判性反思”两个维度分别检验;对话数据经编码后用 ENA 构建认知网络并做组间比较。
三、发现一:苏格拉底式智能体显著提升学业成绩
概念知识测验的结果(原文 Table 2):
| 组别 | N | 前测 M (SD) | 后测 M (SD) | 统计量 |
|---|---|---|---|---|
| 实验组 S-ICA | 48 | 68.05 (1.19) | 86.44 (1.04) | – |
| 对照组 nS-ICA | 46 | 67.60 (1.68) | 85.17 (1.90) | – |
| LMM: Time 主效应 | – | – | – | β̂=17.568, SE=0.307, z=57.23, p<0.001 |
| LMM: Condition 主效应 | – | – | – | β̂=0.450, SE=0.304, z=1.48, p=0.138 |
| Time × Condition 交互 | – | – | – | β̂=0.821, SE=0.430, z=1.91, p=0.056(边缘显著) |
| ANCOVA Condition 效应 | – | – | – | γ̂=1.366, SE=0.329, t=4.15, p<0.001 |
几个值得细读的数字:
- 两组都大幅进步:实验组从 M=68.05(SD=1.19)提升到 M=86.44(SD=1.04),对照组从 M=67.60(SD=1.68)提升到 M=85.17(SD=1.90)。Time 主效应极强(β̂=17.568,z=57.23,p<0.001)——无论是否使用苏格拉底策略,LLM 对话本身就是有效的学习工具,学习发生是普遍现象。
- 裸比较中组间差异不显著:Condition 主效应(β̂=0.450,z=1.48,p=0.138)与交互项(β̂=0.821,p=0.056)均未达到传统显著水平。这说明粗看之下,苏格拉底智能体与普通智能体的成绩差异并不大——两组后测均值只差 1.27 分。
- 但校正前测后,差异显著浮现:以 ANCOVA 校正前测水平后,Condition 效应 γ̂=1.366(SE=0.329,t=4.15,p<0.001)。前测上两组已有微小差距(68.05 vs 67.60),且实验组前测的标准差更小(1.19 vs 1.68),LMM 与 ANCOVA 对这类基线差异的处理方式不同,导致结论强度不同。ANCOVA 的结果表明:在控制了起点差异之后,苏格拉底式对话带来了稳定且统计显著的学业增益。论文报告的效应量 Hedges’ g=0.35,属于小到中等效应。
这一组结果本身就是一个方法论提醒:干预研究的结论高度依赖统计模型的选择——LMM 的交互项只是边缘显著(p=0.056),而 ANCOVA 达到 p<0.001,两类模型回答的是略有不同的问题(前者检验“变化量是否因组而异”,后者检验“终态是否在控制起点后因组而异”)。
四、发现二:反思性思维在“反思”与“批判性反思”维度显著提升
学业成绩之外,论文的核心主张在反思性思维。与对照组相比,实验组在反思性思维量表上整体更优,且提升主要集中在“反思”与“批判性反思”两个深层维度——这正与苏格拉底式提问的机制假设吻合:
- 反思(reflection):苏格拉底追问迫使学习者回看自己的回答过程、评估理解是否完整,对应“意识到自己知道什么、不知道什么”;
- 批判性反思(critical reflection):反诘与矛盾揭示促使学习者质疑原有假设、重构概念框架,对应“质疑并重建自己的认知结构”。
相比之下,浅层的“习惯性行动(habitual action)“与”理解(understanding)“维度两组差异有限——这符合预期:无论哪种智能体,学生都在”理解“新内容;但只有被持续追问的学生,才被迫进入对自己思维过程的检视。反思性思维并非成绩的副产品,而是苏格拉底循环直接塑造的认知技能。
五、发现三:ENA 揭示实验组激活更多高阶认知路径
论文最独特的证据来自过程数据。两组与智能体的全部对话被编码为认知单元后,用认知网络分析(ENA)建模“认知要素如何在学习过程中共现”,并以网络图呈现两组的认知路径结构。
ENA 的发现(Figure 9、Figure 10):
- 空间分离:两组在网络空间中的质心分布显著分离,说明两组的认知网络结构在统计上可区分;
- 路径差异:实验组激活了更多高阶认知路径——网络中高阶认知要素(评价、反思、质疑、整合)之间的连接更强、更密集;对照组的网络则更集中于低阶要素(回忆、复述、理解)之间的连接;
- 机制对应:这一结构与量表结果相互印证——苏格拉底式提问不仅让学生“答得更好”(成绩),更让他们在对话中更多地走过了高阶认知路径(反思、批判、整合)。ENA 提供了量表之外的、基于行为数据的机制证据。
换句话说:成绩差异只是冰山一角,对话过程的认知结构差异才是苏格拉底策略真正改变的东西——这也是本文相对一般“AI 教学效果研究”的方法论贡献。
精读笔记
核心论点:把苏格拉底提问策略嵌入 LLM 对话智能体是可行的,且这种“以问代答”的设计在学业成绩与反思性思维上均优于“直接作答”的普通智能体。ANCOVA 校正后成绩效应显著(γ̂=1.366,p<0.001,Hedges’ g=0.35),反思性思维在“反思”与“批判性反思”维度提升最明显;ENA 显示实验组对话激活了更多高阶认知路径。提问策略不是装饰,而是改变学习认知结构的功能性机制。
方法要点:
- 精心设计的对照系统 nS-ICA 隔离了“苏格拉底策略”这一单一变量,是判断因果的关键
- 三证据链设计:学业测验(结果)+ 反思量表(心理构念)+ ENA 对话网络(过程行为),互相印证
- LMM 与 ANCOVA 并报,呈现了模型选择对结论强度的影响,值得方法学借鉴
- ENA 把质性对话编码转化为可统计的网络结构,为“高阶思维”提供了过程性操作化
局限与边界:
- 样本量有限(N=94)且为单一课程、单一文化背景(中国大学生),效应量 Hedges’ g=0.35 偏小,推广需谨慎
- 干预周期较短,长期保持效应未知;反思性思维提升是否迁移到后续学习,论文未追踪
- 苏格拉底策略与 LLM 语义生成的具体实现细节(模型版本、提示词、策略触发逻辑)影响可复现性
- 前测组间微小差异(68.05 vs 67.60)与标准差差异使 LMM 与 ANCOVA 结论不一致(p=0.056 vs p<0.001),解读需同时参考两类模型
可延伸方向:
- 苏格拉底策略对不同学科与不同认知负荷任务的效果是否一致?追问密度是否存在最优区间?
- 反思性思维量表提升与 ENA 高阶路径激活,能否预测后续课程中的迁移表现?
- 当学习者为低先验知识或低自我效能的学生时,“以问代答”是否会因缺乏支架而失效?是否需要在提问与提示之间自适应切换?
- LLM 智能体的提问质量如何自动评估?能否用另一个模型实时监测苏格拉底循环是否真正推进了认知深度?
原文地址
- DOI:10.1016/j.compedu.2026.105494
- 期刊:Computers & Education, 2026, 241, 105494
- 图表来源:原文 Figure 9(ENA 空间分布)、Figure 10(ENA 网络对比)、Table 2(概念知识测验描述统计与推断统计)