中文

Visual-O1:通过多模态多轮思维链推理理解模糊指令

计算机视觉与模式识别 2024-10-07 v1

摘要

随着大规模模型的发展,语言指令越来越多地被用于多模态任务中。由于人类语言习惯,这些指令在现实场景中常常包含歧义,需要结合视觉上下文或常识才能准确解读。然而,即使是高性能的大型模型,在处理模糊指令时也表现出显著的性能限制,其较弱的消歧推理能力可能导致灾难性错误。为解决此问题,本文提出了Visual-O1,一种多模态多轮思维链推理框架。该框架模拟人类的多模态多轮推理过程,为高智能模型提供实例经验,或为通用智能模型提供经验,以理解模糊指令。与传统方法要求模型具备高智能以理解长文本或进行冗长复杂推理不同,我们的框架不会显著增加计算开销,并且更具通用性和有效性,即使对于通用智能模型也是如此。实验表明,我们的方法不仅显著提升了不同智能水平模型在模糊指令上的性能,也提高了它们在一般任务上的表现。我们的工作凸显了人工智能在具有不确定性和歧义的真实场景中像人类一样工作的潜力。

关键词

引用

@article{arxiv.2410.03321,
  title  = {Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning},
  author = {Minheng Ni and Yutao Fan and Lei Zhang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2410.03321},
  year   = {2024}
}