中文

LLM 在长文本生成中的原子级校准

计算与语言 2025-11-21 v3 人工智能

摘要

大型语言模型(LLM)常因幻觉现象而存在显著挑战,这对实际应用构成障碍。置信度校准作为一种有效的幻觉指示器,因而对于增强 LLM 的可信度至关重要。先前工作主要聚焦于短形式任务,使用单一响应级别得分(宏观校准),这对于可能同时包含准确与不准确主张的长文本输出而言不足。本文系统性地研究了原子级校准,即通过将长响应分解为原子主张来进行粒度细致的事实性校准。我们进一步将现有置信度诱导方法归类为判别式和生成式类型,并提出两种新的置信度融合策略以提高校准水平。我们的实验表明,LLM 在长文本生成过程中在原子级表现出较差的校准。更重要的是,原子级校准揭示了置信度方法与置信度变化之间的洞见模式,这为置信度估计在长文本生成中的未来研究方向提供了启发。

关键词

引用

@article{arxiv.2410.13246,
  title  = {Atomic Calibration of LLMs in Long-Form Generations},
  author = {Caiqi Zhang and Ruihan Yang and Zhisong Zhang and Xinting Huang and Sen Yang and Dong Yu and Nigel Collier},
  journal= {arXiv preprint arXiv:2410.13246},
  year   = {2025}
}

备注

ACL 2025 KnowFM Oral / AACL-IJCNLP 2025