返回文献精选

AI 素养问卷的设计与验证:情感、行为、认知与伦理四维路径

论文精读:Ng 等(2024)基于 335/508/363 名学生三阶段跨样本验证,开发 ABCE 四维 AI 素养问卷,并通过二阶模型确认高阶 AI 素养因子。

文献:Ng, D. T. K., Wu, W., Leung, J. K. L., Chiu, T. K. F., & Chu, S. K. W. (2024). Design and validation of the AI literacy questionnaire: The affective, behavioural, cognitive and ethical approach. British Journal of Educational Technology, 55(3), 1082–1104. DOI 10.1111/bjet.13411。

研究问题:随着生成式 AI 进入课堂与日常生活,“AI 素养”成为教育研究的高频概念,但学界对其结构界定与测量工具远未达成共识——多数研究仍借用一般数字素养量表或自编单维度题目,缺乏一套经过严格心理测量学验证的 AI 素养量表。论文要回答:AI 素养应由哪些维度构成?如何设计并验证一份兼具结构效度信度的 AI 素养问卷(AI Literacy Questionnaire, AILQ)?

论证思路:从作者团队前期的 K-12 AI 素养系统综述出发,提出情感(Affective)、行为(Behavioural)、认知(Cognitive)、伦理(Ethical)四维框架(ABCE),据此编写题目;随后以三阶段、三个独立学生样本(335 → 508 → 363 名)依次完成项目分析、探索性因子分析(EFA)、验证性因子分析(CFA)与二阶模型检验,用跨样本交叉验证回答“四维结构是否稳定、四维之上是否存在高阶 AI 素养因子”。

一、研究背景:AI 素养测量的“工具赤字”

AI 素养(AI literacy)被广泛视为数字时代公民的基本素养,但概念上长期存在两大混乱:一是维度之争——有人强调会使用工具(操作层面),有人强调理解原理(认知层面),还有人强调负责任地使用(伦理层面);二是测量之争——许多研究直接搬用“数字素养”“信息素养”问卷,无法捕捉 AI 特有的伦理与创造维度。作者团队此前的系统综述将 K-12 AI 素养整合为四类能力,本文则把该概念框架转化为可操作的测量工具,回答“如何测”这一基础问题。

二、ABCE 四维框架详解

问卷的理论内核是 ABCE 四维框架,四个维度分别对应 AI 素养的不同侧面:

  • 情感维度(Affective):个体对 AI 的态度、价值判断与学习动机,如“我认为学习 AI 很重要”“我愿意了解 AI 技术”。它回答“想不想学、如何看待 AI”,是素养形成的情感前提;
  • 行为维度(Behavioural):个体实际使用、操作 AI 工具与参与 AI 相关活动的程度,如使用频率与主动探索行为。它回答“用不用、会不会用”;
  • 认知维度(Cognitive):对 AI 原理、能力边界与应用方式的理解层次。依据布鲁姆教育目标分类,从“知道与理解 AI”(低阶)到“应用 AI”,再到“创造 AI”(高阶),形成递进阶梯(见原文图2);
  • 伦理维度(Ethical):对 AI 伦理议题(隐私、偏见、公平、人类责任)的认知与判断,如“使用 AI 时应考虑数据隐私”“AI 决策不能替代人类责任”。它回答“该不该用、如何负责任地用”。
原文图2 认知层次
图2(原文 Figure 2)AI 素养认知层次:知道与理解 AI(低阶)到应用、创造(高阶)

四个维度的设计各有学理出处:认知维度承袭经典的 AI 教育目标层级,情感与行为维度借鉴技术接受与数字素养研究,伦理维度则回应 AI 特有的社会影响——这正是 AI 素养区别于一般数字素养的关键增量。

三、三阶段开发与验证:335 → 508 → 363

问卷开发遵循心理测量学标准流程,以三个独立样本分阶段推进,样本均来自中小学教育项目(primary/secondary school education project)的学生。

阶段一:项目开发与探索性因子分析(N = 335)

依据四维框架编写初始题项,交由领域专家评审内容效度后,对 335 名学生施测。EFA 结果支持四因子结构,各题项在预设维度上载荷清晰,据此删改题目,形成四维度的精简量表。

阶段二:验证性因子分析(N = 508)

508 名学生为独立样本进行 CFA,检验预设的四因子测量模型。模型拟合指标与因子载荷达到可接受标准,四维结构在第二个样本中复现,支持结构的稳定性。

阶段三:二阶模型检验(N = 363)

以第三个独立样本(363 名学生)检验二阶模型:四个一阶因子之上是否存在一个高阶“AI 素养”因子。二阶 CFA 模型的拟合以 χ² 及其与自由度之比(χ²/df)等指标报告,结果支持高阶因子结构——即四个维度既相对独立,又共同隶属于一个整体的“AI 素养”构念。这一结果在概念上至关重要:它说明 AI 素养不是四个互不相干的维度拼盘,而是一个可整体度量、可整体比较的复合构念,为后续用总分或总均分进行群体比较提供了统计依据。

四、信效度检验结果

  • 信度:各维度报告了内部一致性系数(Cronbach’s α 与/或 McDonald’s ω),均达到可接受水平(> 0.70),跨样本稳定;
  • 收敛效度:各维度组合信度(CR)与平均方差抽取量(AVE)满足常用阈值,说明各维度内部题目测量的是同一构念;
  • 区分效度:四维度之间相关适度、且与各自 AVE 满足区分效度判据,说明情感、行为、认知、伦理确实是可区分的四个侧面;
  • 结构效度:三阶段(EFA → CFA → 二阶 CFA)逐级确认因子结构,并以三个独立样本交叉验证,结构效度证据链条完整。

五、应用价值与影响

该问卷是 AI 素养测量领域的代表性工具之一,其价值体现在三方面:

  • 测量标准化:为研究者提供了一份公开、经过严格验证的四维量表,终结了“各测各的”局面,使不同研究的结果可以横向比较;
  • 维度框架化:ABCE 框架把 AI 素养从笼统的口号变成可操作的四维结构,尤其将伦理维度确立为 AI 素养区别于一般数字素养的核心特征——这是框架最突出的理论贡献;
  • 场景迁移性:问卷虽基于 K-12 框架开发,但四维结构在高等教育与成人研究中被广泛采纳(在谷歌学术被大量引用),成为 AI 素养实证研究的“标配”测量之一。

精读笔记

核心论点:AI 素养是一个由情感、行为、认知、伦理四维度构成、且四维之上存在高阶总因子的复合构念;通过三阶段、三个独立样本(335/508/363 名学生)的问卷开发,ABCE 框架获得了实证支持,伦理维度是 AI 素养区别于一般数字素养的关键特征。

方法要点

  • 三阶段三样本的设计是问卷开发的范本:EFA 探索结构 → CFA 验证结构 → 二阶模型检验构念层级,每一步都用独立样本,避免同一样本反复使用的过拟合问题
  • 二阶模型检验回答了“四维之上是否有总因子”这一概念问题,用 χ² 等拟合指标给出统计证据,为总分使用提供依据
  • 题目编写锚定既有 K-12 AI 素养框架,内容效度有系统综述背书,而非凭空编题

局限与边界

  • 样本来自中小学教育项目学生,问卷在学龄段群体中验证,向成人、职业人群推广仍需跨群体验证
  • 测量以自我报告为主,测得的是“自评素养”而非客观能力表现,与社会期望偏差、共同方法偏差相关
  • 三阶段样本均属同一项目背景,跨文化、跨课程情境的普适性尚待检验
  • 发表时点(2024 年初)早于主流生成式 AI 工具的普及,伦理与行为题项对生成式 AI 场景的覆盖有限

可延伸方向:将问卷迁移至大学生与在职教师群体并重新验证测量不变性;开发与自评互补的表现型测量(如任务式评测);扩充伦理维度以覆盖生成式 AI 的深度伪造、算法偏见等新议题;用纵向追踪考察四维度随课程干预的动态变化。

原文地址

  • DOI:10.1111/bjet.13411
  • 期刊:British Journal of Educational Technology(BJET),2024 年,第 55 卷第 3 期,第 1082–1104 页(IF 8.1,Q1)
  • 图表来源:原文 Figure 2(AI 素养认知层次)