中文

基于语义扰动的视觉语言模型对象级语言化置信度校准

计算机视觉与模式识别 2025-04-22 v1

摘要

视觉语言模型(VLMs)在各种多模态任务中表现出色,但常常存在置信度校准不佳的问题,导致其语言化置信度与响应正确性不一致。这种置信度不校准会削弱用户的信任,尤其是在模型自信地提供错误或虚构信息时。本文提出了一种名为语义扰动置信度校准(CSP)框架,以提高 VLMs 在对象中心查询下的语言化置信度校准。我们首先引入了一个扰动数据集,通过对关键对象区域施加高斯噪声来模拟不同置信度水平下的视觉不确定性,从而在视觉模糊性与置信度之间建立明确的映射关系。我们进一步通过两个阶段的训练过程来增强校准:一个是在扰动数据集上进行的监督微调,另一个进行偏好优化。广泛的实验表明,我们的方法显著改善了语言化置信度与响应正确性之间的对齐程度,同时保持或提升了整体任务性能。这些结果凸显了语义扰动作为提升 VLMs 可靠性和可解释性的实用工具的潜力。

关键词

引用

@article{arxiv.2504.14847,
  title  = {Reliable Multi-Modal Object Re-Identification via Modality-Aware Graph Reasoning},
  author = {Xixi Wan and Aihua Zheng and Zi Wang and Bo Jiang and Jin Tang and Jixin Ma},
  journal= {arXiv preprint arXiv:2504.14847},
  year   = {2025}
}