中文

Ola:挑战多模态语言模型的极限

计算机视觉与模式识别 2025-06-04 v3 计算与语言 多媒体 声音 音频与语音处理 图像与视频处理

摘要

近期大型语言模型的突破,尤其是 GPT-4o 之后,推动了开发能理解更多模态的全模态模型的热潮。尽管部分开源替代方案涌现,但仍与专注单一模态的模型在性能上存在显著差距。本文提出 Ola,一款全模态语言模型,在图像、视频与音频理解能力上均与专用模型持水平竞争,大幅推动了全模态语言模型的发展边界。我们系统探索了构建稳健全模态模型所必需的架构设计、数据策划与训练策略。Ola 通过若干关键且有效的改进超越主流基线,集成先进的视觉理解与音频识别能力。此外,我们重新思考全模态训练中的跨模态关系,强调以视频为中枢桥梁的跨模态对齐,并提出渐进式训练流程:从最具差异性的模态开始,逐步逼近更紧密的模态对齐。广泛实验表明,Ola 在所有模态上超越现有开源全模态 LLM,同时在相近规模的 SOTA 单模态模型中也实现高度竞争的表现。我们旨使 Ola 成为开放式全模态理解解决方案,推动此新兴领域的后续研究发展。模型权重、代码与数据已开源于 https://github.com/Ola-Omni/Ola。

关键词

引用

@article{arxiv.2502.04328,
  title  = {Ola: Pushing the Frontiers of Omni-Modal Language Model},
  author = {Zuyan Liu and Yuhao Dong and Jiahui Wang and Ziwei Liu and Winston Hu and Jiwen Lu and Yongming Rao},
  journal= {arXiv preprint arXiv:2502.04328},
  year   = {2025}
}