中文

大语言模型破解:量化使用大语言模型进行文本标注的隐藏风险

计算与语言 2025-10-07 v2 人工智能 机器学习

摘要

大语言模型正快速变革社会科学研究,通过自动化完成数据标注与文本分析等耗时的任务。然而,LLM 输出在研究人员所做的实现选择(如模型选择或提示策略)的不同情况下会有显著差异。这种差异可能引入系统性偏差和随机误差,进而传递至下游分析,导致 Type I(假阳性)、Type II(假阴性)、Type S(符号错误)或 Type M(放大效应)误差。我们将此现象称为 LLM 破解(LLM hacking),即配置选择导致结论错误。我们发现,刻意的 LLM 破解极其简单。通过复制 37 个来自 21 项已发表社会科学研究中的数据标注任务,我们展示,只需通过少量提示词改写,几乎即可将任何事物呈现为统计显著。除了故意操控外,我们分析了来自 18 个不同 LLM 的 1300 万条标签在 2361 个真实假设情境下的风险,亦显示即便遵循标准研究实践, accidental LLM 破解 的风险仍高。我们发现,针对最先进 LLM 的约 31% 的假设会得出错误结论,针对较小语言模型则约有一半的假设会出错。虽然更高的任务性能和更强的通用模型能力可降低 LLM 破解风险,但即便是高度准确的模型也仍具脆弱性。LLM 破解风险随效应规模增加而降低,表明需对 LLM 基于显著性阈值附近的发现进行更严格的验证。我们分析了 21 项缓解措施,发现人工标注提供了防止假阳性的关键保护。常见的回归估计量校正技术可恢复有效推断,但会在 Type I 与 Type II 误差之间进行权衡。我们发布了一系列实用性建议,以防止 LLM 破解。

关键词

引用

@article{arxiv.2509.08825,
  title  = {Large Language Model Hacking: Quantifying the Hidden Risks of Using LLMs for Text Annotation},
  author = {Joachim Baumann and Paul Röttger and Aleksandra Urman and Albert Wendsjö and Flor Miriam Plaza-del-Arco and Johannes B. Gruber and Dirk Hovy},
  journal= {arXiv preprint arXiv:2509.08825},
  year   = {2025}
}