中文

视觉思维链:以多模态填充弥合逻辑鸿沟

计算与语言 2024-01-24 v3 计算机视觉与模式识别

摘要

大语言模型近期的进展引发了思维链中的推理,使模型能以类人的方式分解问题。尽管这一范式提升了语言模型的多步推理能力,但其受限于单模态且主要应用于问答任务。我们主张,将视觉增强融入推理至关重要,尤其对于复杂、富有想象力的任务。为此,我们引入 VCoT,一种利用带视觉-语言接地的思维链提示递归弥合序列数据内逻辑鸿沟的新方法。我们的方法使用视觉引导生成合成多模态填充,添加一致且新颖的信息,以减少可从时序推理获益的下游任务中的逻辑鸿沟,并为模型的多步推理提供可解释性。我们将 VCoT 应用于视觉叙事和 WikiHow 摘要数据集,并通过人工评估表明,VCoT 提供的新颖且一致的合成数据增强优于思维链基线,可用于提升下游性能。

关键词

引用

@article{arxiv.2305.02317,
  title  = {Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings},
  author = {Daniel Rose and Vaishnavi Himakunthala and Andy Ouyang and Ryan He and Alex Mei and Yujie Lu and Michael Saxon and Chinmay Sonar and Diba Mirza and William Yang Wang},
  journal= {arXiv preprint arXiv:2305.02317},
  year   = {2024}
}