中文

Baichuan-Omni技术报告

人工智能 2024-12-30 v4 计算与语言 计算机视觉与模式识别

摘要

GPT-4o 的显著多模态能力和交互体验凸显了其在实际应用中的关键作用,但缺乏高性能的开源替代方案。本文介绍了 Baichuan-omni,这是首个能够同时处理和分析图像、视频、音频和文本模态的开源7B多模态大语言模型(MLLM),同时提供先进的多模态交互体验和强大的性能。我们提出了一种有效的多模态训练方案,首先从7B模型开始,经过两阶段的多模态对齐和跨音频、图像、视频和文本模态的多任务微调。这一方法使语言模型能够有效处理视觉和音频数据。该模型在各种全模态和多模态基准测试中表现出色,我们希望这一贡献为开源社区在推进多模态理解和实时交互方面提供竞争基线。

关键词

引用

@article{arxiv.2410.08565,
  title  = {Baichuan-Omni Technical Report},
  author = {Yadong Li and Haoze Sun and Mingan Lin and Tianpeng Li and Guosheng Dong and Tao Zhang and Bowen Ding and Wei Song and Zhenglin Cheng and Yuqi Huo and Song Chen and Xu Li and Da Pan and Shusen Zhang and Xin Wu and Zheng Liang and Jun Liu and Tao Zhang and Keer Lu and Yaqi Zhao and Yanjun Shen and Fan Yang and Kaicheng Yu and Tao Lin and Jianhua Xu and Zenan Zhou and Weipeng Chen},
  journal= {arXiv preprint arXiv:2410.08565},
  year   = {2024}
}