返回文献精选

反思性对话还是提示词精炼?辅导脚手架对学生独立使用 LLM 编程的影响

论文精读:Brender 等(2026)在研究生移动机器人课程中开展两阶段研究,比较苏格拉底引导(SG)与提示词精炼(PR)两类辅导脚手架对学习结果、提示实践与后续独立 LLM 使用的影响。

文献:Brender, J., El-Hamamsy, L., Uittenhove, K., Perez, A., Jermann, P., Mondada, F., & Bumbacher, E. (2026). Reflective dialogue or prompt refinement? Effects of tutor scaffolding on students’ independent LLM use for programming. In: Lecture Notes in Computer Science (AIED 2026). Springer.

研究问题:大语言模型(LLM)正在重塑编程教育,但学生与 LLM 的交互方式高度分化——有人把 LLM 当作“答案机”直接索取代码,有人则把它当作“思考伙伴”在对话中学习。论文要回答的是:在引导学生使用 LLM 编程时,辅导脚手架的类型(如何组织学生与 LLM 的交互)是否会改变学生的提示实践、学习结果,以及一旦脚手架撤除、学生在无约束条件下独立使用 LLM 的方式?具体比较两类脚手架:苏格拉底引导(Socratic Guidance, SG)——通过对话式提问组织交互,让学生自己发现问题、诊断错误、形成理解;提示词精炼(Prompt Refinement, PR)——直接指导学生在提示中提供任务、约束与期望输出,把“写出有效提示词”本身当作可优化的技能。

论证思路:作者采用两阶段纵向研究设计。第一阶段是 6 周的受引导干预:66 名研究生被分配至 SG 或 PR 两种辅导条件下使用 LLM 完成编程任务,考察“脚手架在场”时的任务表现与提示模式;第二阶段是 3 周的课程项目:52 名学生(第一阶段完成后)在无任何脚手架约束的条件下自由使用 LLM,考察脚手架撤除后学习结果与提示策略的迁移差异。通过“引导期—自由期”的对比,作者试图分离脚手架对任务完成(即时绩效)与对能力内化(延迟学习)的不同影响。

一、研究背景:从“LLM 辅助编程”走向“用 LLM 学习”

LLM 编程助手(如 Copilot、ChatGPT)已广泛进入编程课堂,其教育价值存在两种叙事:乐观者认为 LLM 降低了编程门槛、即时反馈能加速学习;担忧者则指出,当学生可以直接索取代码时,容易产生自动化偏见机会主义使用——跳过问题理解与调试环节,把 LLM 输出当作最终答案直接采纳,导致浅层学习甚至“做了任务但没学会”。已有研究多聚焦于“学生是否使用 LLM”“使用频率如何”,较少追问一个更具可设计性的问题:教育者能否通过脚手架改变学生与 LLM 的交互方式,从而改变学习结果?

本文的切入点正是这一设计空间。作者区分了两类在原理上对立的脚手架取向:SG 把 LLM 交互组织为认知对话——辅导者通过追问(“这个错误说明什么?”“你的假设是什么?”)迫使学生在提问与解答之间完成推理;PR 则把 LLM 交互组织为工具操作——辅导者教学生把需求转化为结构良好的提示词,追求一次交互就得到高质量输出。两类脚手架都“有用”,但内化的认知习惯可能截然不同:SG 训练的是“理解驱动”的提问者,PR 训练的是“高效驱动”的指令者。这一对比构成本文的核心实验操纵。

二、两类辅导脚手架的设计对比

维度 苏格拉底引导(SG) 提示词精炼(PR)
交互组织方式 对话式提问,辅导者以追问引导 指令式建构,辅导者指导提示词撰写
辅导者的角色 反思促进者:不直接给答案,用问题推动推理 工具教练:示范如何描述任务、约束与期望输出
学生被训练的能力 诊断问题、形成假设、解释代码行为 明确需求、组织上下文、结构化表达
与 LLM 的关系隐喻 “思考伙伴”:在对话中共同推理 “高效工具”:一次给出好的指令得到好的结果
交互成本 高(多轮往返、显性推理负担) 低(可直接获取答案式输出)

简言之,SG 让“提问的质量”成为学习的中介,PR 让“提示词的质量”成为产出的中介。二者在引导期内都可能帮助学生完成任务,但其塑造的认知习惯——是“先理解再提问”还是“先描述再索取”——是否随脚手架撤除而保留,正是本文要检验的核心问题。

三、两阶段研究设计

原文图1 研究设计
图1(原文 Figure 1)研究设计概览

研究在研究生移动机器人课程的编程任务情境中开展,包含两个阶段:

阶段一(引导期,6 周):66 名学生被分配到 SG 或 PR 两种辅导条件下,使用 LLM 完成一系列编程任务。此阶段收集两类过程性证据:一是任务表现——能否正确完成任务;二是提示模式——对提示词进行编码分析,考察学生是否在提示中体现对问题的理解(如描述代码意图、报告错误诊断、要求解释而非仅索取代码),以及提问的回合结构与信息完整度。

阶段二(自由期,3 周):52 名学生进入课程项目,不再提供任何脚手架,允许无约束地使用 LLM。此阶段测量学生在“裸用”条件下的学习结果(理解测验)与提示策略,检验阶段一习得的交互习惯是否迁移、迁移是否带来不同的学习增益。

两阶段设计的关键逻辑是:若两种脚手架在引导期表现相似(说明都能“帮助完成任务”),但在自由期的学习结果与提示策略出现分化,则差异只能归因于脚手架内化的认知习惯,而非任务完成能力本身。

四、研究结果

4.1 引导期:任务表现与提示模式相似

在 6 周受引导使用期间,SG 与 PR 两组学生的任务表现没有显著差异提示模式也大体相似。这说明两类脚手架作为“完成任务的支持手段”是等价的——都帮助学生顺利走完了引导期。若研究止步于此,结论将是“脚手架类型无关紧要”。

4.2 自由期:学习结果与后续 LLM 使用分化

原文图2 学习结果
图2(原文 Figure 2)S3 学习结果:各条件与时间的标准化均分

脚手架撤除后的图景完全不同。后期学习结果显示(图2):SG 学生获得了更高的后期学习增益,且其后续无约束 LLM 使用呈现出不同的提示策略——SG 学生更可能采用“理解驱动”的提示策略,即在提示中先呈现对问题的理解、预测或诊断,再要求 LLM 协助,而不是直接索取完整代码;而这种理解驱动策略是预测更高理解水平的中间机制。换言之,SG 训练出的提问习惯在无脚手架条件下被保留,并通过“带着理解去用 LLM”的路径带来了更好的学习结果。

4.3 感知效率与学习收益的权衡

值得注意的是,学习者主观认为 SG 辅导效率更低——对话式引导需要更多轮次、更多显性思考,不如 PR 那样“直给”。然而正是这种被感知为“低效”的过程,支撑了长期学习收益:SG 学生随时间发展出”用 LLM 学习“的能力,而 PR 学生更多停留在”用 LLM 完成任务“的水平。短期效率感知与长期学习收益之间存在系统性权衡。

五、讨论与教育启示

本文的核心贡献在于把“脚手架类型”确立为决定 LLM 教育效果的关键设计变量:

第一,脚手架类型决定“用 LLM 学习”的能力是否被内化。PR 优化的是工具使用效率,其收益随脚手架撤除而衰减;SG 塑造的是认知参与习惯,其收益在无约束条件下依然显现。教育者选择脚手架时,实际是在选择希望学生内化的与 LLM 的关系。

第二,效率感知可能误导设计决策。SG 被感知为低效,恰是因为它把认知负担留在学习者一侧;若课程以学生满意度或即时产出为指标,容易误判 SG“不好”。本文提示:需要区分“任务完成指标”与“学习指标”,后者才是脚手架设计的评价标准。

第三,理解驱动提示策略是可教的、可迁移的教学目标。提示策略不再是“会不会写 prompt”的操作问题,而是“是否带着理解使用 LLM”的认知问题——这为编程课程(乃至更广泛的学科)设计 LLM 使用规范提供了可操作的抓手。

六、精读笔记

核心论点:LLM 编程辅导中,脚手架的组织方式决定了学生与 LLM 交互习惯的长期内化:苏格拉底引导(反思性对话)与提示词精炼(工具优化)在引导期内任务表现等价,但前者带来更高的后期学习增益,并使学生更可能在无约束条件下采用“理解驱动”的提示策略——该策略是预测更高理解的中间机制;尽管 SG 被学习者感知为效率更低,它支持了“用 LLM 学习”能力的形成。

方法要点

  • 两阶段纵向设计(6 周引导期 + 3 周自由期)是本文的方法精髓:用“脚手架在场”与“脚手架撤除”的对比,把即时绩效与能力内化分离,从而识别仅靠单阶段实验无法观测的延迟效应
  • 对提示词进行过程性编码分析,将“提示模式/策略”作为中介变量纳入因果链条,超越了“只看最终成绩”的结果取向
  • 同时采集任务表现、提示策略、学习结果与主观效率感知四类证据,支撑“引导期相似—自由期分化—感知与收益背离”的完整论证

局限与边界

  • 样本为单一高校研究生移动机器人课程,人数规模有限(66 人引导期、52 人自由期),统计检验力与外推性受限,向本科生、其他学科推广需谨慎
  • 两阶段样本量存在流失(66→52),需关注自选择与流失偏差对自由期结果的影响
  • 提示策略编码依赖人工标注,编码信度与分类粒度会影响中介分析结论
  • 研究以编程任务为载体,“理解驱动”策略在其他任务类型(写作、推理、数据分析)中的迁移效果尚待检验

可延伸方向:将 SG 脚手架实现为可扩展的智能辅导系统并检验其规模化效果;用学习日志与眼动等细粒度数据刻画“理解驱动”提示背后的认知过程;考察不同先验水平学生从两类脚手架中的获益差异(支架适配);把提示策略测量发展为标准化工具,用于更大规模、更多学科的准实验与追踪研究;比较“脚手架撤除后衰减”与“长期维持”的时间曲线,确定脚手架的最佳撤除时机。

原文地址

  • 期刊:Lecture Notes in Computer Science(AIED 2026),Springer
  • 图表来源:原文 Figure 1(研究设计概览)、Figure 2(S3 学习结果:各条件与时间的标准化均分)