中文

当模型不一致时:公共意见分析中重新思考 LLM 评估

人工智能 2026-05-29 v1 计算机与社会 人机交互

摘要

联邦机构正在部署大语言模型(LLM)来对公共意见语料库进行分类,其中模型对记录的组织方式将塑造政策制定者看到的内容以及哪些论点值得关注。基于小型验证数据集的 stance 准确性锚定的标准评估无法检测不同模型对相同公共输入进行实质性不同分类的情况。我们提出了一种解释性审计管道,将多模型不一致视为解释复杂性的诊断工具,并引导人类审阅针对真正模糊的公共输入。分析了 1,260 条关于美国农业部(USDA)一个联邦 docket 的公共意见,跨四个 LLM,我们发现模型间的主题性差异超过模型内部的提示变异,并且专家评级标准抑制了深层解释性不一致而未解决其根本问题。在对 40 条抽样评论进行两阶段标注研究中,四个 LLM 和一个人类标注者独立标注后,再看到其他标注者的标签进行修订。修订行为在不同标注者之间存在差异,人类标注者的修订经常引入集体输出中缺失的框架。我们认为,不一致性为 LLM 辅助解释性编码提供了必要的补充,超越准确性指标。

关键词

引用

@article{arxiv.2605.29025,
  title  = {When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis},
  author = {Aisha Najera and Alvin Moon and Vedant Srinivasan and Rajesh Veeraraghavan},
  journal= {arXiv preprint arXiv:2605.29025},
  year   = {2026}
}