OmniVinci:提升多模态理解 LLM 的架构与数据
计算机视觉与模式识别
2025-10-29 v2 人工智能
计算与语言
摘要
推进机器智能需要develop 跨多模态感知能力,类似于人类感知世界。我们引入 OmniVinci,一个构建强大、开源、全模态 LLM 的倡议。我们深入研究模型架构和数据 curation 的设计选择。对于模型架构,我们提出三项关键创新:(i)OmniAlignNet 用于在共享多模态潜在空间中加强视觉与音频嵌入的对齐;(ii)Temporal Embedding Grouping 用于捕捉视觉与音频信号之间的相对时间对齐;(iii)Constrained Rotary Time Embedding 用于在多模态嵌入中编码绝对时间信息。我们引入一个 curation 与 synthesis 流程,生成 2400 万单模态和多模态对话。我们发现不同模态在感知和推理中相互强化。我们的模型 OmniVinci 在 DailyOmni(跨模态理解)上超越 Qwen2.5-Omni +19.05,在 MMAR(音频)上 +1.7,在 Video-MME(视觉)上 +3.9,仅使用 0.2T 训练 token——相较 Qwen2.5-Omni 的 1.2T 训练 token 减少 6 倍。我们最终展示了 OmniVinci 在机器人、医疗 AI 和智能制造等下游应用中的多模态优势。
引用
@article{arxiv.2510.15870,
title = {OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM},
author = {Hanrong Ye and Chao-Han Huck Yang and Arushi Goel and Wei Huang and Ligeng Zhu and Yuanhang Su and Sean Lin and An-Chieh Cheng and Zhen Wan and Jinchuan Tian and Yuming Lou and Dong Yang and Zhijian Liu and Yukang Chen and Ambrish Dantrey and Ehsan Jahangiri and Sreyan Ghosh and Daguang Xu and Ehsan Hosseini-Asl and Danial Mohseni Taheri and Vidya Murali and Sifei Liu and Yao Lu and Oluwatobi Olabiyi and Yu-Chiang Frank Wang and Rafael Valle and Bryan Catanzaro and Andrew Tao and Song Han and Jan Kautz and Hongxu Yin and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2510.15870},
year = {2025}
}
备注
Technical Report. Code: https://github.com/NVlabs/OmniVinci