中文

演示:LLM 的偏见与错误的统计显著结果不保证可泛化结果

计算与语言 2025-11-05 v1 人工智能 人机交互 机器学习

摘要

近期研究表明,幻觉、遗漏和偏见在 LLM 的日常应用场景中十分常见。然而,用于医疗情境下的聊天机器人必须在非医疗因素涉及时(例如患者人口统计信息存在时)提供一致的建议。为理解医疗聊天机器人未能按预期运行的条件,我们开发了一个基础设施:1)自动生成查询以探测 LLM;2)使用多套 LLM-as-a-judge 设置和提示评估这些查询的答案。对于 1),我们的提示创建管道从患者人口统计、病史、疾病和写作风格中抽样,以创建逼真的问题。对于 2),我们的评估管道提供基于 LLM-as-a-judge 的幻觉和遗漏检测,以及代理工作流程,此外还有 LLM-as-a-judge 类别检测器。作为基准研究,我们进行两个案例研究:跨 LLM 一致性以及不同答案和评估 LLM 的影响。我们发现 LLM 标注员表现出较低的一致性得分(平均 Cohen's Kappa κ=0.118\kappa=0.118),且只有特定(答案、评估)LLM 组合在不同写作风格、性别和种族上才显示统计显著差异。我们建议使用 LLM 评估时采用多个 LLM 作为评估者,以避免在缺乏真实数据时得出统计显著但不可泛化的结果。我们还建议公布跨 LLM 一致性指标以提高透明度。我们的代码和数据集已在此处提供:https://github.com/BBN-E/medic-neurips-2025-demo。

关键词

引用

@article{arxiv.2511.02246,
  title  = {Demo: Statistically Significant Results On Biases and Errors of LLMs Do Not Guarantee Generalizable Results},
  author = {Jonathan Liu and Haoling Qiu and Jonathan Lasko and Damianos Karakos and Mahsa Yarmohammadi and Mark Dredze},
  journal= {arXiv preprint arXiv:2511.02246},
  year   = {2025}
}