MMBoundary:通过推理步骤置信度校准提升 MLLM 知识边界感知
计算与语言
2025-06-30 v3
摘要
近年来,多模态大语言模型(MLLMs)取得了显著进展,但在多模态推理方面仍面临固有挑战,这需要多层级(如感知、推理)与多粒度(如多步推理链)的高级推理。先前关于估计模型置信度的工作往往侧重于整体响应进行训练与校准,却未能评估每个推理步骤的置信度,导致不期望的幻觉滚雪球现象。在本工作中,我们提出了 MMBoundary,一个通过推理步骤置信度校准提升 MLLM 知识边界感知的新框架。为此,我们提出结合互补的文本与跨模态自奖励信号,以估计 MLLM 推理过程每一步的置信度。除了在该组自奖励置信度估计信号上对 MLLM 进行监督微调以实现初始置信度表达预热外,我们还引入了具有多个奖励函数的强化学习阶段,以进一步对齐模型知识并在每个推理步骤校准置信度,从而增强推理链的自我纠正。实证结果表明,MMBoundary 在不同领域数据集与指标上均显著优于现有方法,平均减少了 7.5% 的多模态置信度校准误差,任务性能提升达 8.3%。
引用
@article{arxiv.2505.23224,
title = {MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence Calibration},
author = {Zhitao He and Sandeep Polisetty and Zhiyuan Fan and Yuchen Huang and Shujin Wu and Yi R. Fung},
journal= {arXiv preprint arXiv:2505.23224},
year = {2025}
}
备注
18 pages, ACL 2025