中文

MetaFaith:LLM 中忠实的自然语言不确定性表达

计算与语言 2025-10-03 v2 机器学习

摘要

LLM 可信度的一个关键组成部分是可靠的不确定性传达,然而 LLM 在传达错误主张时经常使用断言性语言,导致过度依赖并侵蚀信任。我们首次对 LLM 的忠实置信度校准进行了系统性研究,在全面的模型、数据集和提示策略上,基准测试了模型使用不确定性语言表达以忠实反映其内在不确定性的能力。我们的结果表明,LLM 在很大程度上无法完成此任务,且现有的干预措施是不充分的:标准提示方法仅提供微小的收益,而现有的基于事实性的校准技术甚至会损害忠实校准。为了解决这一关键差距,我们引入了 MetaFaith,一种受人类元认知启发的新型基于提示的校准方法。我们表明,MetaFaith 在不同的模型和任务领域稳健地改善了忠实校准,实现了高达 61% 的忠实度提升,并获得了 83% 的人类评判胜率。

关键词

引用

@article{arxiv.2505.24858,
  title  = {MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs},
  author = {Gabrielle Kaili-May Liu and Gal Yona and Avi Caciularu and Idan Szpektor and Tim G. J. Rudner and Arman Cohan},
  journal= {arXiv preprint arXiv:2505.24858},
  year   = {2025}
}

备注

EMNLP 2025