Chimera:通过领域特定专家提升通用模型
计算机视觉与模式识别
2025-07-29 v3
摘要
大型多模态模型 (LMM) 的近期进展凸显了通过增加图像-文本配对数据来实现规模化扩张的重要性,这些数据在通用任务上取得了令人印象深刻的性能。尽管这些模型在广泛应用中效果良好,但通用模型主要在网页规模数据集上训练,数据集以自然图像为主,导致牺牲了针对需要大量领域先验知识的特定领域任务的专项能力。此外,直接将为特定领域量身定制的专家模型集成到通用模型中也面临表示差距和模型之间优化不平衡的挑战。为此,我们引入 Chimera,一个可扩展且成本低的多模态管道,旨在提升现有 LMM 的领域特定专家能力。具体而言,我们设计了渐进式训练策略,将专家模型的特征集成到通用 LMM 输入中。为解决由于良好对齐的通用视觉编码器导致的优化不平衡问题,我们引入了一种新颖的通用-专家协作掩码 (GSCM) 机制。结果得到一个在图表、表格、数学和文档等领域均表现出色的通用模型,在多模态推理和视觉内容抽取任务上实现了最先进的性能,这些都是评估现有 LMM 具有挑战性的任务。
引用
@article{arxiv.2412.05983,
title = {Chimera: Improving Generalist Model with Domain-Specific Experts},
author = {Tianshuo Peng and Mingsheng Li and Jiakang Yuan and Hongbin Zhou and Renqiu Xia and Renrui Zhang and Lei Bai and Song Mao and Bin Wang and Aojun Zhou and Botian Shi and Tao Chen and Bo Zhang and Xiangyu Yue},
journal= {arXiv preprint arXiv:2412.05983},
year = {2025}
}
备注
Accepted by ICCV-2025, Chimera Homepage: https://alpha-innovator.github.io/chimera_page