中文

TorchUMM:用于评估、分析和后训练的统一多模态模型代码库

人工智能 2026-05-21 v2

摘要

统一多模态模型(UMM)的最新进展导致了能够跨视觉和文本模态进行理解、生成和编辑的架构激增。然而,由于模型架构的多样性以及训练范式和实现细节的异质性,为UMM开发统一框架仍然具有挑战性。在本文中,我们提出了TorchUMM,这是第一个用于跨不同UMM骨干网络、任务和数据集进行综合评估、分析和后训练的统一代码库。TorchUMM支持涵盖广泛规模和设计范式的多种模型。我们的基准测试涵盖三个核心任务维度:多模态理解、生成和编辑,并整合了既有和新颖的数据集,以评估感知、推理、组合性和指令遵循能力。通过提供统一接口和标准化评估协议,TorchUMM实现了跨异构模型的公平和可重复比较,并促进对其优势和局限性的更深入理解,从而有助于开发更强大的统一多模态系统。代码可在以下网址获取:https://github.com/AIFrontierLab/TorchUMM。

关键词

引用

@article{arxiv.2604.10784,
  title  = {TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training},
  author = {Yinyi Luo and Wenwen Wang and Hayes Bai and Hongyu Zhu and Hao Chen and Pan He and Marios Savvides and Sharon Li and Jindong Wang},
  journal= {arXiv preprint arXiv:2604.10784},
  year   = {2026}
}

备注

Technical Report