面向语言模型思维链推理的多模态潜在空间学习
人工智能
2023-12-15 v1
摘要
思维链推理在语言模型解决复杂任务和回答问题方面展示了出色的性能。然而,许多现实世界的问题需要多模态信息,例如文本和图像。以往关于多模态 CoT 的研究主要集中在从现成的视觉模型中提取固定的图像特征,然后使用注意力机制将其与文本融合。这种方法存在局限性,因为这些视觉模型并非为复杂推理任务而设计,且与语言思维不能很好地对齐。为了克服这一局限性,我们引入了一种新颖的多模态 CoT 推理方法,该方法利用通过扩散过程进行的潜在空间学习来生成与语言思维对齐的有效图像特征。我们的方法在深层融合了图像特征和文本表示,并提升了多模态 CoT 的复杂推理能力。我们在多模态 ScienceQA 和机器翻译基准上证明了所提方法的有效性,并在 ScienceQA 上取得了 SOTA 性能。总体而言,我们的方法为语言模型中的多模态推理提供了更鲁棒和有效的解决方案,增强了其解决现实世界复杂问题的能力。
引用
@article{arxiv.2312.08762,
title = {Multi-modal Latent Space Learning for Chain-of-Thought Reasoning in Language Models},
author = {Liqi He and Zuchao Li and Xiantao Cai and Ping Wang},
journal= {arXiv preprint arXiv:2312.08762},
year = {2023}
}