BBA:大型视觉 - 语言模型推理的双模态行为对齐
计算与语言
2024-02-22 v1
摘要
多模态推理是大型视觉 - 语言模型(LVLMs)的一项关键能力。与领域特定语言(DSL)的集成提供了精确的视觉表示,使这些模型有机会在复杂和专业领域执行更准确的推理。然而,传统的思维链(CoT)提示方法在有效利用视觉和 DSL 表示的独特优势方面面临挑战,主要是由于它们不同的推理机制。此外,它在解决多步推理任务中的关键步骤方面往往不足。为了缓解这些挑战,我们引入了双模态行为对齐(BBA)提示方法,旨在最大化 DSL 在增强复杂多模态推理任务中的潜力。该方法首先引导 LVLMs 为视觉和 DSL 表示创建独立的推理链。随后,通过解决任何不一致性来对齐这些链,从而实现不同模态行为的 cohesive 整合。我们的实验表明,BBA 显著提高了 GPT-4V(ision) 在几何问题求解()、国际象棋位置优势预测()和分子属性预测()方面的性能。
引用
@article{arxiv.2402.13577,
title = {BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models},
author = {Xueliang Zhao and Xinting Huang and Tingchen Fu and Qintong Li and Shansan Gong and Lemao Liu and Wei Bi and Lingpeng Kong},
journal= {arXiv preprint arXiv:2402.13577},
year = {2024}
}
备注
Preprint