共识陷阱:解构主观性与“真实答案”幻觉在数据标注中的机制
人工智能
2026-04-28 v3 计算与语言
计算机与社会
摘要
在机器学习中,“ground truth”指的是用于训练和评估模型的假设性正确标签。然而,基础的“ground truth”范例建立在一种实证主义谬误之上,将人类 disagreement 视为技术噪声而非至关重要的社会技术信号。本系统性文献综述分析了2020至2025年间发表于 ACL、AIES、CHI、CSCW、EAAMO、FAccT 和 NeurIPS 等七大顶尖会议的研究,探讨数据标注实践中促成此“consensus trap”的机制。我们对346篇论文进行自省性主题分析,揭示了在位置可见性系统性失效,结合最近向 human-as-verifier 模型的架构转变——Specifically 依赖于 model-mediated 标注——引入深层锚定偏见并有效地将人类声音从循环中移出。我们进一步展示了地理霸权如何施加西方规范作为普遍基准,往往通过神秘的 alignment 精神数据 worker 为避免经济惩罚而优先满足 requesters。我们批判性地批评了将多样性误诊为 error 的“noisy sensor”谬误,主张重新捕获 disagreement 作为构建文化相对模型所必需的高保真信号。为解决这些系统性张力,我们提出了一套Pluralistic annotation 基础设施的路线图,将目标从发现单一“正确”答案转向映射人类经验的多样性。
引用
@article{arxiv.2602.11318,
title = {The Consensus Trap: Dissecting Subjectivity and the "Ground Truth" Illusion in Data Annotation},
author = {Sheza Munir and Benjamin Mah and Krisha Kalsi and Shivani Kapania and Julian Posada and Edith Law and Ding Wang and Syed Ishtiaque Ahmed},
journal= {arXiv preprint arXiv:2602.11318},
year = {2026}
}