中文

通过自理由校准实现 LVLMs 的理由-答案对齐

计算机视觉与模式识别 2025-09-18 v1

摘要

大型视觉语言模型(LVLMs)已展现出强大的视觉问答能力,但仍在理由与生成答案之间保持对齐方面存在挑战,导致推理不一致和错误响应。为此,本文引入了自理由校准(SRC)框架,以迭代校准理由与答案之间的对齐。SRC 首先采用轻量级“理由微调”方法,该方法修改模型的响应格式,要求在生成答案而无需显式提示的情况下先生成理由。接着,SRC 为每个样本搜索一组多样化的候选响应,并提出了用于评估理由质量和事实一致性的配对评分策略,称为 R-Scorer。基于置信度加权的偏好精选过程,SRC 将对齐校准解耦为偏好微调的方式,从而在多个基准测试中显著提高了 LVLMs 在感知、推理和泛化方面的表现。我们的结果强调了在探索 LVLMs 的潜能方面,理由导向的对齐的重要性。

关键词

引用

@article{arxiv.2509.13919,
  title  = {Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration},
  author = {Yuanchen Wu and Ke Yan and Shouhong Ding and Ziyin Zhou and Xiaoqiang Li},
  journal= {arXiv preprint arXiv:2509.13919},
  year   = {2025}
}

备注

Accepted by ICML 2025