中文

不要弃权!识别并解决不确定性

人工智能 2025-06-03 v1

摘要

尽管大型语言模型在各个领域得到广泛应用,但它们在遇到不确定场景时经常表现出过度自信,而现有解决方案主要依赖于回避性回复(例如“我不知道”),忽略了识别和处理不确定性以生成更令人满意的回复的机会。为了系统地研究和提高 LLM 识别和处理不确定性来源的能力,我们引入了 \textbf{ConfuseBench},一个主要关注三种不确定性的基准:文档稀缺、能力有限和查询歧义。在 ConfuseBench 上的实验表明,当前 LLM 难以准确识别不确定性的根本原因并加以解决。它们倾向于将不确定性归因于查询歧义,而忽略了能力限制,尤其是那些较弱的模型。为了应对这一挑战,我们首先生成上下文感知的询问,以突出原始查询中令人困惑的方面。然后我们根据询问答案的唯一性来判断不确定性的来源。进一步,我们使用一种 on-policy 训练方法 InteractDPO 来生成更好的询问。实验结果证明了我们方法的有效性。

关键词

引用

@article{arxiv.2506.00780,
  title  = {Do not Abstain! Identify and Solve the Uncertainty},
  author = {Jingyu Liu and Jingquan Peng and xiaopeng Wu and Xubin Li and Tiezheng Ge and Bo Zheng and Yong Liu},
  journal= {arXiv preprint arXiv:2506.00780},
  year   = {2025}
}