中文

ThinkOmni:通过引导解码将文本推理提升至全模态场景

计算机视觉与模式识别 2026-03-24 v2

摘要

全模态推理对智能系统理解和从多样化数据源中进行推断至关重要。虽然现有的全模态大语言模型(OLLM)在感知多模态方面表现优异,但它们缺乏近期大规模推理模型(LRM)的复杂推理能力。然而,通过额外训练来增强OLLM的推理能力存在诸多挑战,包括需要高质量数据、任务特定适配以及巨大的计算成本。为此,我们提出了ThinkOmni,一个无训练、无数据驱动的框架,将文本推理提升至全模态场景。ThinkOmni引入了两个关键组件:1)LRM-as-a-Guide,该组件利用即插即用的LRM引导OLLM的解码过程;2)Stepwise Contrastive Scaling,该组件在无需手动调参的情况下自适应地平衡感知与推理信号。在六个多模态推理基准测试中进行实验,表明ThinkOmni consistently 提供了性能提升,主要结果在MathVista上达到70.2,在MMAU上达到75.5。总体而言,ThinkOmni提供了一个灵活且可推广的全模态推理解决方案,并为推理能力的泛化和应用提供了新的见解。代码已公开available at https://github.com/1ranGuan/thinkomni

关键词

引用

@article{arxiv.2602.23306,
  title  = {ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding},
  author = {Yiran Guan and Sifan Tu and Dingkang Liang and Linghao Zhu and Jianzhong Ju and Zhenbo Luo and Jian Luan and Yuliang Liu and Xiang Bai},
  journal= {arXiv preprint arXiv:2602.23306},
  year   = {2026}
}

备注

Accept by ICLR 2026, Code: https://github.com/1ranGuan/thinkomni