改进视觉语言模型的链条推理
人工智能
2024-10-22 v1 计算机视觉与模式识别
摘要
视觉语言模型(VLM)中的链式推理(CoT)对于提高可解释性和可信度至关重要。然而,当前的训练配方缺乏健壮的 CoT 推理数据,依赖以短注释为主且理由最小化的数据集。在本工作中,我们表明,在短答案上进行训练的 VLM 对需要更详细响应的推理任务不具备良好泛化能力。为此,我们提出了两种方法。首先,从 GPT-4o 模型中提炼理由以丰富训练数据并微调 VLM,从而提升其 CoT 性能。其次,我们应用强化学习进一步校准推理质量。具体而言,我们构建了正(正确)和负(错误)模型生成理由链的配对数据,通过将其预测与标注短答案进行比较。使用这类配对数据,我们应用直接偏好优化(DPO)算法来细化模型的推理能力。我们的实验表明,在基准数据集上显著提高了 CoT 推理性能,并且更好地泛化到直接答案预测。本工作强调,在训练中包含详细理由的重要性,以及利用强化学习加强 VLM 推理能力的作用。
引用
@article{arxiv.2410.16198,
title = {Improve Vision Language Model Chain-of-thought Reasoning},
author = {Ruohong Zhang and Bowen Zhang and Yanghao Li and Haotian Zhang and Zhiqing Sun and Zhe Gan and Yinfei Yang and Ruoming Pang and Yiming Yang},
journal= {arXiv preprint arXiv:2410.16198},
year = {2024}
}
备注
10 pages + appendix