MEXA:面向通用多模态推理的动态多专家聚合
计算机视觉与模式识别
2025-10-28 v2 人工智能
计算与语言
摘要
将预训练专家模型组合提供了大量潜力用于可扩展的多模态推理,但构建统一框架仍具有挑战性,这源于输入模态和任务复杂性日益增长的多样性。例如,医疗诊断需要对结构化临床表格进行精确推理,而金融预测则依赖于解释基于图表的数据以做出明智的预测。为解决这一挑战,我们引入 MEXA,这是一种无需训练的框架,可实现针对输入模态和任务特定推理需求(即技能)的专家模型动态选择,从而在不同且独特的领域中实现有效的多模态推理。每个专家模型专为特定模态-任务对生成可解释的文本推理输出。MEXA 然后通过大型推理模型(LRM)对这些输出进行聚合和推理,以生成最终答案。这种模块化设计允许在无需额外训练开销的情况下跨越 diverse 领域进行灵活且透明的多模态推理。我们在 diverse 多模态基准上广泛评估了该方法,包括视频推理、音频推理、3D 理解和医疗问答。MEXA 在强大的多模态基准上持续实现性能提升,凸显了专家驱动的选择和聚合在 diverse 多模态推理任务中的有效性和广泛适用性。
引用
@article{arxiv.2506.17113,
title = {MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation},
author = {Shoubin Yu and Yue Zhang and Ziyang Wang and Jaehong Yoon and Mohit Bansal},
journal= {arXiv preprint arXiv:2506.17113},
year = {2025}
}
备注
EMNLP 2025 Findings; The first two authors contributed equally; Github link: https://github.com/Yui010206/MEXA