中文

开源多模态 Moxin 模型:Moxin-VLM 与 Moxin-VLA

计算与语言 2026-02-05 v2 计算机视觉与模式识别 机器学习

摘要

最近,大型语言模型(LLM)经历了显著的变革,表现出快速增长的流行度和能力。领导这一演变的是专有型LLM,如GPT-4和GPT-o1,这些模型因其卓越的性能和多样性在AI社区引起广泛关注。与此同时,开源LLM,如LLaMA和Mistral,由于便于在多样化应用中进行定制和部署,为LLM的日益流行作出了重要贡献。我们介绍了Moxin 7B——一个完全开源的LLM,依据模型开放框架开发,该框架超越了简单共享模型权重, embracing 模型训练、数据集和实现细节的完全透明度,从而促进更具包容性和合作性的研究环境,维持健康的开源生态系统。为进一步赋予Moxin在不同任务中的多样化能力,我们开发了三个变体,包括Moxin-VLM、Moxin-VLA和Moxin-Chinese,分别针对视觉语言、视觉语言动作和中文能力。实验表明,我们的模型在各种评估中实现了优异的性能。我们采用开源框架和开放数据进行训练。我们发布了我们的模型,以及可用于推导这些模型的可用数据和代码。

关键词

引用

@article{arxiv.2512.22208,
  title  = {Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA},
  author = {Pu Zhao and Arash Akbari and Xuan Shen and Zhenglun Kong and Yixin Shen and Sung-En Chang and Timothy Rupprecht and Lei Lu and Enfu Nan and Changdi Yang and Yumei He and Weiyan Shi and Xingchen Xu and Yu Huang and Wei Jiang and Wei Wang and Yue Chen and Yong He and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2512.22208},
  year   = {2026}
}