中文

置信度悖论:大语言模型能否识别自身错误

人工智能 2025-10-29 v2

摘要

文档视觉问答(DocVQA)模型常常在面对不确定情况时 produce 过度自信或伦理不合乎道德的回答。现有模型如 LayoutLMv3、UDOP 和 DONUT 专注于准确率,但缺乏伦理校准能力。我们提出了 HonestVQA,这是一个模型无关、自监督的框架,通过加权损失和对比学习将模型置信度与正确性保持一致。我们引入了两个新指标诚实得分(H-Score)和伦理置信指数(ECI)来评估伦理对齐程度。HonestVQA 在 SpDocVQA、InfographicsVQA 和 SROIE 数据集上均提升了准确率和 F1 分数最高可达 4.3%,同时降低了过度自信现象。该方法在不同领域间也表现出良好的泛化能力,达到 78.9% 的准确率和 76.1% 的 F1 分数。

关键词

引用

@article{arxiv.2506.23464,
  title  = {The Confidence Paradox: Can LLM Know When It's Wrong},
  author = {Sahil Tripathi and Md Tabrez Nafis and Imran Hussain and Jiechao Gao},
  journal= {arXiv preprint arXiv:2506.23464},
  year   = {2025}
}

备注

Accepted at the 14th IJCNLP & 4th AACL 2025 (Main)