通过自一致性训练提升小型多模态推理模型以匹配更大模型的能力
人工智能
2024-07-04 v2
摘要
多模态推理是一项具有挑战性的任务,要求模型跨多种模态进行推理以回答问题。现有方法通过将语言与视觉模态纳入两阶段推理框架,将 rationale 生成与答案推断分离,从而取得了一定进展。然而,这些方法常因生成的 rationale 质量不足而表现欠佳。在本工作中,我们深入探究了 rationale 在模型推理中的重要性。我们观察到,当 rationale 完全准确时,模型的准确率显著提升,这凸显了高质量 rationale 生成的必要性。受此启发,我们提出 MC-CoT,一种自一致性训练策略,其生成多个 rationale 与答案,随后通过投票过程选出最准确者。该方法不仅提升了生成 rationale 的质量,也带来了更准确且鲁棒的答案。通过大量实验,我们证明了我们的方法在多个基准上显著提升了模型性能。值得注意的是,我们表明即便是更小的基模型,在配备我们所提方法后,也能取得与更大模型相当的结果,这说明了我们的方法在利用 rationale 之力以改进多模态推理方面的潜力。代码见 https://github.com/chengtan9907/mc-cot。
引用
@article{arxiv.2311.14109,
title = {Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency Training},
author = {Cheng Tan and Jingxuan Wei and Zhangyang Gao and Linzhuang Sun and Siyuan Li and Ruifeng Guo and Bihui Yu and Stan Z. Li},
journal= {arXiv preprint arXiv:2311.14109},
year = {2024}
}
备注
Accepted by ECCV 2024