从答案到理由:基于答案导向的自对齐多模态推理
计算与语言
2025-07-29 v2
摘要
实现类人推理能力一直是多模态大语言模型(MLLMs)的长期目标。当前方法主要聚焦于综合正向理由,往往依赖人工标注或复杂系统,而且常常忽视了负向推理,这限制了模型在多模态推理中的泛化能力和鲁棒性。为此,我们提出了一种新框架:基于答案导向的自对齐多模态推理(SMART)。SMART 采用答案导向的链式思考(answer-oriented chain-of-thought, AoT)提示自动构建高质量数据。drawing inspiration from human proof-based strategies, AoT 利用正确答案和错误答案,从中提取关联问题与答案的关键视觉信息。当提供正确答案时,模型会生成强大的正向理由;当正确答案被替换为错误答案时,模型会生成一种错误却令人信服的推理路径,作为一种判别性负向理由。使用 AoT 生成的数据训练的模型在准确率和可解释性方面优于基于人工标注数据集训练的模型,展示了卓越的推理能力。因此,SMART 建立了一种迭代式生成-优化方法,不断提升模型的推理技能。实验表明,SMART 框架能显著改善各种 MLLMs 的表现,无论其架构、参数规模或预训练数据集如何。代码已公开于 https://github.com/WentaoTan/SMART。
引用
@article{arxiv.2507.02984,
title = {From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought},
author = {Wentao Tan and Qiong Cao and Yibing Zhan and Chao Xue and Changxing Ding},
journal= {arXiv preprint arXiv:2507.02984},
year = {2025}
}