中文

我们能在人群中隐藏机器吗?量化 LLM 介入标注任务中的等价性

信息检索 2025-10-30 v2

摘要

许多大语言模型(LLM)在文本标注评估中主要关注输出的正确性,通常通过标准性能指标将模型生成的标签与人工标注的“ground truth”进行比较。相比之下,本研究超越了仅考虑有效性的问题。我们旨在探索如何对人类与 LLM 的标注决策进行统计评估。我们不将 LLM 仅仅当作标注系统来对待,而是将其视为一种可能能够模仿人类主观判断的替代标注机制。为此,我们 developed 一种基于 Krippendorff's α\alpha、配对抽样(paired bootstrapping)和双单侧 t 检验(Two One-Sided t-Tests, TOST)等价检验程序的统计评估方法。该方法测试 LLM 是否能够在人类标注者群体中无缝融合,无法被区分。我们将其应用于两个数据集——MovieLens 100K 和 PolitiFact,发现在前者中(p=0.004p = 0.004),LLM 与人类标注者在统计上不可区分;但在后者中(p=0.155p = 0.155)则不可区分,这凸显了任务依赖性差异。该方法还支持基于小规模人类数据进行早期评估,以指导 LLM 是否适用于特定应用的大规模标注。

关键词

引用

@article{arxiv.2510.06658,
  title  = {Can We Hide Machines in the Crowd? Quantifying Equivalence in LLM-in-the-loop Annotation Tasks},
  author = {Jiaman He and Zikang Leng and Dana McKay and Damiano Spina and Johanne R. Trippas},
  journal= {arXiv preprint arXiv:2510.06658},
  year   = {2025}
}

备注

Accepted at SIGIR-AP 2025