HumanOmniV2:从理解到具备上下文的全模态推理
计算机视觉与模式识别
2025-06-27 v1 计算与语言
摘要
随着多模态大型语言模型的快速发展,对人类意图的深入理解和解释能力已成为关键能力,这需要详尽且深思的推理。在近期研究中,强化学习(RL)在增强大型语言模型(LLM)的推理能力方面显示出潜力。然而,将RL应用于多模态数据和格式的挑战仍未得到充分解决。在本文中,我们确定了现有多模态推理模型中的两个问题:全球上下文理解不足和捷径问题。不足的上下文理解可能在模型误解多模态上下文导致错误答案时发生。捷径问题是指模型忽略了多模态输入中关键线索,直接针对查询进行回答而不考虑多模态信息。在解决这些问题方面,我们强调模型必须在多模态输入的全局上下文理解基础上进行推理。这种全局上下文理解可以有效防止模型忽视关键多模态线索,确保全面的推理过程。为确保准确解释多模态上下文信息,我们实现了一个由大型语言模型判断的上下文奖励,以及格式和准确性奖励。此外,为了提高复杂推理能力,我们使用LLM来评估逻辑奖励,确定推理过程是否成功地将多模态信息与逻辑方法相结合。我们还引入了一个推理全模态基准,IntentBench,旨在评估模型在理解复杂人类意图和情感方面的能力。我们的方法在多个全模态基准上显示出优异的性能,优于其他开源全模态模型。
引用
@article{arxiv.2506.21277,
title = {HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context},
author = {Qize Yang and Shimin Yao and Weixuan Chen and Shenghao Fu and Detao Bai and Jiaxing Zhao and Boyuan Sun and Bowen Yin and Xihan Wei and Jingren Zhou},
journal= {arXiv preprint arXiv:2506.21277},
year = {2025}
}