R2-T2:面向多模态混合专家的测试时重新路由
机器学习
2025-03-04 v2
摘要
在大型多模态模型 (LMMs) 中,非语言模态(如视觉表征)的感知通常不及大语言模型 (LLMs) 的强大推理能力,这阻碍了 LMMs 在具有挑战性的下游任务中发挥良好性能。近期通过将视觉编码器替换为混合专家 (MoE) 来缓解了这一弱点,该 MoE 提供丰富、多层次且多样化的表征,以满足不同下游任务的需求。多模态 MoE 的性能很大程度上取决于其路由器,它为每个输入重新加权和混合不同专家的表征。然而,我们发现端到端训练的路由器并不总是为每个测试样本产生最优路由权重。为弥合这一差距,我们提出一种新颖且高效的方法 "在测试时重新路由 (R2-T2)",通过将测试样本的路由向量局部优化至邻近正确预测样本的路由向量来实现。我们提出了三种 R2-T2 策略,具有不同的优化目标和邻居搜索空间。R2-T2 在不训练任何基础模型参数的前提下,对 LMMs 在具有挑战性基准测试上的 diverse 任务性能实现了显著且持续的提升。
引用
@article{arxiv.2502.20395,
title = {R2-T2: Re-Routing in Test-Time for Multimodal Mixture-of-Experts},
author = {Zhongyang Li and Ziyue Li and Tianyi Zhou},
journal= {arXiv preprint arXiv:2502.20395},
year = {2025}
}