通过自理由校准实现 LVLMs 的理由-答案对齐
计算机视觉与模式识别
2025-09-18 v1
摘要
大型视觉语言模型(LVLMs)已展现出强大的视觉问答能力,但仍在理由与生成答案之间保持对齐方面存在挑战,导致推理不一致和错误响应。为此,本文引入了自理由校准(SRC)框架,以迭代校准理由与答案之间的对齐。SRC 首先采用轻量级“理由微调”方法,该方法修改模型的响应格式,要求在生成答案而无需显式提示的情况下先生成理由。接着,SRC 为每个样本搜索一组多样化的候选响应,并提出了用于评估理由质量和事实一致性的配对评分策略,称为 R-Scorer。基于置信度加权的偏好精选过程,SRC 将对齐校准解耦为偏好微调的方式,从而在多个基准测试中显著提高了 LVLMs 在感知、推理和泛化方面的表现。我们的结果强调了在探索 LVLMs 的潜能方面,理由导向的对齐的重要性。
引用
@article{arxiv.2509.13919,
title = {Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration},
author = {Yuanchen Wu and Ke Yan and Shouhong Ding and Ziyin Zhou and Xiaoqiang Li},
journal= {arXiv preprint arXiv:2509.13919},
year = {2025}
}
备注
Accepted by ICML 2025