返回黑/白板前的冥想

大学老师,上课「演」给 AI 看?——AI 评教能测的,和真正关乎教学质量的

整理「麦可思研究」《大学老师,上课「演」给AI看》并作分析:AI 课堂反馈系统如何进入大学课堂、为什么简单的表象指标评价不了复杂的教学质量、以及当「好看的数据」影响评价时,教师为什么会开始「演」给算法看。文末给出五条可操作建议:让 AI 数据做线索,而不是结论。

配备摄像与录播设备的大学阶梯教室
文首配图:一所大学的阶梯教室(图中可见吸顶摄像头与录播设备)。图片来源:极昼工作室《摄像头凝视下,我从大学老师变成「表演者」》(澎湃新闻转载),即本文所引报道之一

整理说明:本文整理自**「麦可思研究」《大学老师,上课「演」给AI看》**(2026-09-19,腾讯新闻转载),引文与政策表述按原文;配图两张分别来自该文与它所引的报道(极昼工作室·澎湃新闻);两张示意图为本站自制。文末「写在后面」是本站的分析与建议。

引子:一节课结束,报告自动生成

原文这样开头:

「上课铃响,教师走进教室,按下多媒体按钮,AI 课堂反馈系统开始运行。它实时记录教师的语速、口头语、板书有无、是否走动,统计学生的抬头率、前排就座率、互动频次。一节课结束,一份数据报告自动生成。」

这几年,用 AI 评价教学正在逐步进入大学课堂。它被寄予的期待是改善课堂质量——「秒级响应异常情况、精准解读课堂状态」,让人工督导难以覆盖的课堂有据可循。但争议也随之而来:能被 AI 测量的课堂行为,真的等于教学质量吗?当这些「好看的数据」开始影响评价,教师会不会开始「演」给算法看?

原文配图:AI 教情学情智能分析产品宣传图
原文配图:市面上「AI 教情学情智能分析」类产品的宣传图(基于课堂教学音视频多模态分析)。图片来源:麦可思研究该文配图

一、AI 评教为什么快速进入课堂

原文强调,这不是高校自发的一场技术尝试,背后有清晰的政策链条:

  • **《教育强国建设规划纲要(2024—2035年)》**明确提出「建立基于大数据和人工智能支持的教育评价和科学决策制度」;
  • 《教育部等六部门关于推进教育新型基础设施建设构建高质量教育支撑体系的指导意见》要求「开发教师能力评估应用,实现伴随式数据采集与过程性评价」,并「深化教育督导信息化,实现大数据支持下的实时监测和精准评估」;
  • 今年 4 月,教育部等五部门在《「人工智能+教育」行动计划》中进一步明确「利用智能技术分析课堂教学行为,开展人工智能循证教研实践」。

在政策指引与技术发展的双重推动下,AI 正在快速进入教学评价环节。对高校而言,它的优势也很具体:弥补人工督导难以覆盖全部课堂的局限无感采集,不增加师生工作量;数据客观,排除主观因素;实时采集、同步分析,能及时发现问题。

但新的问题随之而来:当课堂被转化为一组组数据,这些数据真的足以说明一堂课上得好不好吗?

二、简单的指标评价不了复杂的教学质量

原文记录了教师抵触情绪的来源——多数不是反对技术,而是质疑评价指标与标准是否科学、合理。两个例子很有代表性:

  • 某高校 AI 巡课中,一位教师的课堂被判定为教学效果不佳,系统给出的理由是「学生使用手机 300 余次」。而实际情况是:学生低头大多是在翻阅教材、开展小组讨论,或按教师要求完成拍照签到
  • 有教师不认同用一套标准化模型衡量所有学科。一位文科教师指出,相关评价体系对课堂的理解带有明显的理工科思维(认为课堂就得有明确的知识点);加上标准十分外在——没有板书要扣分、讲课要时不时走到学生中去、还要有眼神互动,这样的教学模式设计「很像中小学课堂」。
容易测量的行为数据与真正关乎教学质量的判断对照
把「容易自动采集的表象指标」与「真正关乎质量却难以采集的维度」分开看(据原文论述整理,本站自制示意)

原文由此给出判断:**不可能用简单的量化指标,来考量复杂的教学质量。**学生低头,不一定意味着没有听课;课堂互动次数多,也不一定意味着学生真的学会了。更重要的是,不同学科、不同课程、不同教学环节本身就有不同的教学规律,很难用一套完全相同的「好课」标准来衡量。

三、不能「有什么数据就分析什么」

为什么简单的表象行为指标,仍会成为一些 AI 评教平台主要依赖的指标?原文给了一个务实的原因:这些数据采集简单,也容易量化和比较。学生的「前排率、抬头率、互动率」,教师的「肢体语言、手势动作、板书行为」,都能通过传感器和算法自动获取。

「问题在于,最容易被测量的表象行为指标,并不一定是最值得评价的。

原文列出两点:

  1. 表象数据难以真实反映教学质量与效果。「学生是否在深度思考」「这节课是否构建了学生的认知框架」,这些真正关乎质量的问题不在可自动采集的范畴之内;而有关教学内容、教学方法的评价与改进部分,也严重缺失。
  2. 一些表象数据与教学质量的关联度其实并不高,用来评价教学容易引发抵触,进而导致管理者与一线教师之间的信任危机

原文举了「语速」这个具体指标:麦可思专家对不同学科教师的语速、音调等特征分析发现,文科教师讲课语速更快,理工科教师因为要讲解、推导公式,语速相对较慢;因此不能用简单的语速指标评价教师表达是否流畅,而要结合语义是否准确、逻辑是否清楚、是否有利于学生理解等多个维度综合判断。

原文的结论很锋利:如果评教指标的设计不是从教学规律和评教需求出发,而是从技术能力出发——系统能捕捉到什么就分析什么——那么就会把原本用于辅助教学评价的 AI 工具,变成一个「课堂行为记录仪」:它可以告诉管理者课堂上发生了什么,却难以提供真正有价值的教学洞察,更难告诉教师应该怎样改进

四、教师不能给 AI「表演」教学

原文最值得警惕的一段在这里:当「好看的数据」开始影响评价结果,教学就可能变成一场给算法看的「演出」

「上课铃一响,教师自动进入『表演模式』:每隔十分钟抛出一个问题,因为 AI 要统计『互动频次』;提问不能太难,否则学生的沉默可能被记录为『参与度低』;为了提高『小组合作』得分,刻意增加形式化讨论;如果考核『抬头』,教师还要积极引导学生频繁举手、抬头。」

于是形成一个反向塑造:**当教师围绕模型指标设计课堂,评价工具就开始塑造教师的教学行为。**所以原文强调,问题不在于「AI 是否该用于评教」,而在于它应该以什么方式参与评教——AI 可以帮助教师发现学生注意力变化、课堂互动情况等过去难以持续观察的数据,也可以为督导和教师提供新的观察视角;但这些数据更适合作为发现问题的线索,而不是直接成为判断教学质量的结论。

写在后面

先说这篇材料的性质

本文整理的对象是机构媒体的评论与案例报道(麦可思研究,引用极昼工作室、中国教育网络、冷杉 RECORD 三篇报道),不是实证研究:它的价值在于把政策背景、一线教师的具体遭遇和评价指标的技术约束串在一起;引用时宜当作观点与案例,而「AI 评教普遍引起抵触」这类总体判断,仍需问卷调查或访谈数据支撑。政策表述我按原文保留,其中两份文件的发布时间已独立核对(六部门指导意见为 2021 年 7 月、五部门文件为 2026 年 4 月)。

五条可操作的建议

原文明确定位了问题(「以什么方式参与」),但没有给出改进路径。结合它的论述,我认为可以落成五条:

让 AI 数据做线索而不是结论:五条建议
「让 AI 数据做线索、而不是结论」的五条建议(本站分析,本站自制示意)
  1. 指标分层:把自动采集的数据限定为线索层(触发复核的信号),教学质量判断交给同行评议+学生学习证据(作业、测验、迁移表现)。这也符合原文对「教学内容与教学方法的评价严重缺失」的批评。
  2. 学科内常模:语速、板书、走动本身就是学科实践差异。用同学科常模比较,比全校统一阈值更接近事实。
  3. 教师参与指标设计:指标由谁定,决定了它是否被认可。让一线教师参与定义「什么叫上得好」,比事后解释为什么扣分有效得多。
  4. 结果用途设限:先用于自我教研、不直接进考核与职称。指标一旦成为考核目标,行为就会向指标靠拢——这是指标的通病,不是教师的问题;把这一点写进制度,比反复强调「不要表演」更管用。
  5. 结论可回溯:报告中每条判断都应能定位到具体证据片段(可回放的时间点),否则教师无法申诉,系统也无法改进。

一个可以马上试的做法

把 AI 报告先给教师本人看,只用于自我教研:这一学期不进督导参考、不进任何考核;学期末由教师自愿分享「哪几条提示真的有用、哪几条是误判」,用这些反馈反过来修指标。一年之后再讨论是否、以及在什么范围内进入督导流程。这样做的好处是:既保留了 AI 在持续性观察上的独特价值(这是人力督导做不到的),又暂时避开了「数据直接决定评价」导致的表演与信任损耗。

而这恰好呼应原文最后那句判断:AI 评教需要解决的不是「还能采集多少数据」,而是「哪些数据真正有助于改进教学」。


来源:麦可思研究《大学老师,上课「演」给AI看》(腾讯新闻,2026-09-19)|所引报道:极昼工作室《摄像头凝视下,我从大学老师变成「表演者」》(澎湃新闻,2026-04-24)