返回文献精选

GPT 作为测量工具:用语言模型给定性数据打分,能否达到人类标注者的水准

论文精读:Asirvatham、Mokski 与 Shleifer(2026,NBER WP 34834)以自研工具包 GABRIEL 检验 GPT 作为测量工具的两项要求——准确性(与人类标注一致)与直接性(读文本本身,而非依赖记忆或相关线索),验证材料包括 300 余个真实标注数据集与 1,141 个二分类任务。主要结论:GPT 标注与人类共识的一致性不低于单个标注者之间的一致性;训练截止前后无污染迹象;剥离信号后评分衰减 98%;作者并用该工具组装 37,000 项技术的数据集,量化出「从发明到普及」的滞后期在一个半世纪内缩短十倍。

文献:Asirvatham, H., Mokski, E., & Shleifer, A. (2026). GPT as a measurement tool. Working paper(亦列为 NBER Working Paper 34834,2026 年 2 月版,共 99 页)。

原文NBER · GPT as a Measurement Tool工具包github.com/openai/GABRIEL(开源)

原文图13:1,141 个二分类任务上的平均准确率与 F1
图 13(原文 Figure 13)在 1,141 个二分类任务上的平均表现(按观测数加权):gpt-5 准确率约 0.81、F1 约 0.75,gpt-5-mini 与 gpt-5-nano 紧随其后

研究问题:把语言模型的输出当作数据使用时,测到的究竟是什么?作者把这一问题拆成两项可比检验的要求:

  • 准确性(accuracy):给定输入,模型的测量应与公认基准一致——主观构念以人类标注为基准,有外部真值的构念(信用分、选举结果)以客观结果为基准;
  • 直接性(directness):测量应由文本本身的信号驱动,而非来自训练数据泄漏、记忆事实,或「相关线索的猜测」(即绕开研究者想让它读的内容)。

为什么值得细读:这是一篇方法论文——它不提出新的社会理论,而是系统检验「LLM 作为测量仪器」能否成立,并给出可操作的验证流程与操作清单。对需要用开放式问卷、访谈、政策文本、课程文件做编码的教育与社科研究者,它回答的正是「我能不能用 GPT 编码、以及怎样才站得住」这个问题。

一、GABRIEL 是什么:不是模型,而是「把 GPT 变成仪器」的封装

GABRIEL(Generalized Attribute-Based Ratings Information Extraction Library)不训练、不微调任何模型,它是对现有语言模型 API 的提示词封装:每个函数(评分、排序、分类、段落编码、信息抽取)对应一个提示模板,由模型完成推理,GABRIEL 负责把同一个问题以完全相同的措辞、输出结构与参数问遍整个语料,并返回结构化表格。作者用了一个类比:GABRIEL 之于 GPT,类似 Stata 之于回归——没有秘密配方,价值在于标准化、规模、可及性与「经过验证的参照点」。

  • 规模:并行调用 API,数万条语料可在数分钟内完成;
  • 成本:按人类阅读速度文献(Brysbaert, 2019)与 $15/小时的众包定价估算,使用最便宜但性能仍高的模型可降低成本约 17,500 倍,即使用最贵的模型也便宜约 700 倍
  • 面向非技术用户:输出为标准表格,可直接进入定量分析。

二、验证设计的规模

原文图12:验证流程示意图
图 12(原文 Figure 12)验证流程:从 HuggingFace 约 317,000 个候选文本数据集出发,经标签筛选(约 3,000)、许可筛选(约 2,200)、LLM 纳入筛查(372 个可用)到 338 个完成清洗与参数化——紫色为 LLM 步骤、灰色为机械筛选、绿色为数据集状态

四个示范数据集(均有多人标注,可测量人类评分者之间的自然分歧):Varieties of Democracy(专家编码,200 余个国家与地区、1789 年至今、3 万余个国家—年观测;本文取 21 个变量、抽 10,000 个国家—年);Formality(Pavlick & Tetreault, 2016;11,274 句);Stanford Politeness Corpus(10,956 条话语);Metacritic 影评(从评论文本预测 0–100 分)。

大规模复制:作者从 HuggingFace 汇总约 300 个全文标注数据集,其中 1,141 个二分类任务(每个任务最多 200 条文本)用于检验「泛化性」——即模型能否在毫不相关的题材之间保持同等水准。

三、准确性:与人类共识的一致性不低于人类彼此之间

  • 相关性(gpt-5 与人类共识):形式度 0.78、21 个 vDem 变量平均 约 0.71、礼貌度 0.55、Metacritic 0.7–0.8 以上;越新的模型越好。
  • 关键检验(HH vs MH):把「模型与人类共识的相关」同「单个标注者与其余标注者共识的相关」相比——人类—人类一致性并未超过模型—人类一致性。在 23 个受测变量上,gpt-5 有 13 个优于人类(12 个 vDem 变量+礼貌度)、3 个落后(2 个 vDem 变量+形式度)、7 个在统计上无法区分。作者的解读是:这类任务本身容许大量裁量空间,因此 0.7 以上的相关已接近天花板。
  • 大规模表现:领先模型中位准确率 0.85,四分位区间约 0.7–0.95;即使第 10 百分位的任务,准确率仍在 0.5 上下或以上
  • 性能来自推理而非记忆:同代中更小的蒸馏模型(gpt-5-mini)仅略逊于 gpt-5,且优于体积更大但缺少推理能力的 gpt-4o——若答案是「背出来的」,无法解释这一模式。

四、稳健性与两项效度检验

提示词稳健性:作者构造 100 个语义等价的提示变体(含不足 100 词的极简提示),测量结果基本相同——「提示词写得好不好」在这一评分式(rubric-based)测量场景中收益有限

污染检验:利用不同模型训练截止日期(最早回溯至 2021 年,最新覆盖至 2024 年)构成的错位比较,检验「数据集发布在训练截止之前 vs 之后」的准确率差异——没有任何模型出现统计上显著的衰减(准确率与 F1 均如此),作者据此认为污染不是这些任务上准确率的主要来源。

原文图23:剥离环境相关内容的合成演讲评分变化
图 23(原文 Figure 23)捷径推断检验:把合成演讲中与环境相关的内容剥离后,「亲环境」评分从约 94 降到 **2.21**(降幅 98%),而同一文本的「左翼」评分几乎不动(97.06 → 93.81)——说明模型是在读研究者指定的信号,而非由「左翼」这一相关属性推测

捷径推断检验:作者另建 gabriel.debias 方法在真实文本上做同类检验(如地方商业管制报告),结论一致——去偏前后评分变化很小。作者提醒这并不证明偏误为零(低统计功效对这些偏误敏感),但认为「从相关线索猜答案」在实践中不是主要问题。

五、实质应用:技术采纳史(37,000 项技术)

原文图28:发明到广泛普及的滞后期随发明年份的变化
图 28(原文 Figure 28)从原型到广泛普及的时间随发明年份的变化:19 世纪的滞后期为 40–60 年,21 世纪降至约 5 年——一个半世纪内缩短十倍(已剔除 2010 年后发明的技术,以避免截尾偏差)
  • 数据集规模:既有历史技术采纳数据集通常仅数百项技术,本文组装了 37,000 余项技术及其多项定性属性的量化评分;
  • 核心发现:采纳滞后从 19 世纪的 40–60 年降到 21 世纪的约 5 年(十倍);回归中「发明年份」系数 −0.224*(SE 0.004),N = 24,431,R² = 0.254
  • 谁更快军事技术比同期其他技术快约 27%,机构类型上军事与企业的技术更快、学术机构最慢
  • 属性解释力:复杂供应链、依赖网络效应、包含大量部件等与更长滞后期相关;竞争性、地缘政治驱动、迭代式技术与更短滞后期相关;作者自陈两个反直觉结果——需要专门训练的技术反而更快、易用技术反而更慢
  • 全部测得的属性合计解释了超额滞后变异的 23%。作者明确说明这些是描述性结果、部分变量可能内生,不是因果结论。

六、作者给研究者的操作清单(附录 B)

  1. 大胆用,但要把它当测量:GPT 是测量工具而非魔法,测量效度(本文所验证的)与统计效度(取决于研究设计)必须分开评估;
  2. 先读样本再设计属性:短文本宜用更简单的属性,或按作者聚合(如把同一用户的 15 条推文合成一条观测);
  3. 先在 ChatGPT 里试:小样本能跑通再上规模;小规模人工校验仍有价值但多数情形不必全面校验
  4. 最大的新风险是 p-hacking——由于测量近乎免费,很容易试上百个属性或属性变体后只报告显著者。作者建议:留出测试集(例如在 50% 的训练子样本上做全部探索、定稿后再在留出集上跑并报告)、记录所有测过的属性及其变体与总数、并按多重比较的实际情况调整显著性阈值。

精读笔记

核心论点:在本文检验的范围内,GPT 的标注不比一个典型人类标注者更差,且往往更接近人类共识;因此凡是可以接受人类标注误差的研究场景,LLM 标注是可用的替代品——但前提是把它当作测量来对待:报告属性定义、记录全部尝试、并保留验证数据。

方法层面值得学习的三点

  1. 「人类—人类一致性」作为基准线:不是问「模型与人类相关多高」,而是问「模型与共识的一致性是否低于单个标注者之间的一致性」。这一基准线比任何绝对阈值都更有说服力,也可直接迁移到自建编码任务的效度论证中。
  2. 两类效度的分离检验:准确性(与基准一致)+直接性(剥离信号后评分是否衰减)。剥离信号的实验设计尤其值得借鉴——它把「模型是否真的在读我指定的内容」变成了可观测的对照实验,而不是靠讨论来论证。
  3. 把测量成本下降带来的新风险写进方法:作者没有停留在「更好更便宜」,而是明确指出低成本测量会放大 p-hacking,并给出留出集与记录清单的操作方案。

对教育研究的迁移价值:开放式问卷、访谈转录、课程与政策文本、课堂话语编码,都是本文方法的直接适用对象。若要用于自己的研究,最小可行流程是:先读样本定属性 → 小样本人工校验 → 在探索子样本上定稿属性 → 在留出集上报告结果 → 记录所有尝试过的属性与变体

局限与引用提示

  • 本文为工作论文,未见同行评议记录;
  • 作者与研究对象的利益关系需如实标注:两位作者任职于 OpenAI,评估的是 OpenAI 自家模型(论文亦声明观点不代表所属机构);尽管验证材料大量来自独立数据集,仍属利益相关方自评,引用时应与独立第三方复现研究区分;
  • 作者自陈证据不完整(「语言模型是新的,证据尚不完整」),且技术采纳部分为描述性分析、非因果
  • 结论的适用边界是**「评分式测量」**:作者明确指出提示工程的收益有限这一结论限于 rubric-based 测量,不适用于多步推理、工具调用等其他任务类型。

来源:桌面积读文献|原文 PDF《GPT as a measurement tool》(99 页,2026 年 2 月版)已按本卡片要点核对(摘要、第 2—6 节、附录 B,以及图 12、13、23、28)