Omni模型中的情境展开
计算机视觉与模式识别
2026-04-24 v1
摘要
我们提出Omni,一个在文本、图像、视频、3D几何及隐藏表示等多种模态上进行原生训练的统一多模态模型。我们发现,这种训练方式使得模型能够实现情境展开(Context Unrolling),即模型在生成预测前对多种模态表征进行显式推理。这一过程使模型能够聚合来自异构模态的互补信息,从而更准确地逼近共享的多模态知识流形,提高下游推理保真度。作为结果,Omni在多模态生成与理解基准测试中均取得优异性能,同时展现出包括文本、图像、视频及3D几何在内的高级多模态推理能力。
引用
@article{arxiv.2604.21921,
title = {Context Unrolling in Omni Models},
author = {Ceyuan Yang and Zhijie Lin and Yang Zhao and Fei Xiao and Hao He and Qi Zhao and Chaorui Deng and Kunchang Li and Zihan Ding and Yuwei Guo and Fuyun Wang and Fangqi Zhu and Xiaonan Nie and Shenhan Zhu and Shanchuan Lin and Hongsheng Li and Weilin Huang and Guang Shi and Haoqi Fan},
journal= {arXiv preprint arXiv:2604.21921},
year = {2026}
}
备注
Report