Capybara-OMNI:构建全模态语言模型的高效范式
计算与语言
2025-04-18 v1 人工智能
计算机视觉与模式识别
摘要
随着多模态大型语言模型(MLLMs)的发展,开源社区涌现出众多杰出成果。由于创建和训练多模态数据对的复杂性,构建强大的MLLMs仍然是一个计算耗时且耗时的过程。在这项工作中,我们引入了Capybara-OMNI,一种以轻量且高效的方式训练并支持理解文本、图像、视频和音频模态的MLLM。我们详细介绍了框架设计、数据构建和训练方案,以逐步开发一个MLLM并获得具有竞争力的性能。我们还提供了实验中使用的独家基准,以展示如何正确验证跨不同模态的理解能力。结果表明,遵循我们的指导,可以高效构建一个在相同规模模型中于各种多模态基准上取得竞争性能的MLLM。此外,为增强模型的指令遵循与对话能力,我们进一步探讨了如何在MLLM理解模型基础上训练对话版本,这更符合用户在与人实时交互等任务中的习惯。我们公开了Capybara-OMNI模型及其基于对话的版本。公开内容包括模型权重、部分训练数据和推理代码,均可在GitHub上获取。
引用
@article{arxiv.2504.12315,
title = {Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models},
author = {Xingguang Ji and Jiakang Wang and Hongzhi Zhang and Jingyuan Zhang and Haonan Zhou and Chenxi Sun and Yahui Liu and Qi Wang and Fuzheng Zhang},
journal= {arXiv preprint arXiv:2504.12315},
year = {2025}
}