中文

合理化或只是说服?LLM 输出质量的错误可验证性维度

人机交互 2026-04-10 v2 人工智能

摘要

在 LLM 被部署到高风险场景时,用户必须判断单个回答的正确性,往往依赖于模型生成的依据,如推理链或解释。然而,目前没有标准衡量标准,这些依据是否帮助用户区分正确回答和错误回答。我们将此概念形式化为错误可验证性,并提出 vbalv_{\text{bal}},一种平衡度量,衡量依据是否使评审者能够准确判断答案的正确性,该度量经与表现出高一致性的人类评审者验证。我们发现,无论是常见的后训练方法或模型扩张,亦或是更有针对性的干预,都未能提升可验证性。我们引入两种成功提升可验证性的方法:反思重述 (RR) 用于数学推理,和 oracle 重述 (OR) 用于事实性问答,两种方法通过融合领域适当的外部信息来提升可验证性。我们的结果确立了错误可验证性作为一种独立于准确性提升之外的响应质量维度,且需要针对性方法来解决。

关键词

引用

@article{arxiv.2604.04418,
  title  = {Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality},
  author = {Xiaoyuan Zhu and Kimberly Le Truong and Riccardo Fogliato and Gokul Swamy and Weijian Zhang and Minglai Yang and Longtian Ye and Bangya Liu and Minghao Liu and Andrew Ilyas and Steven Wu},
  journal= {arXiv preprint arXiv:2604.04418},
  year   = {2026}
}