基于双Mixture-of-Experts的统一多模态视觉跟踪
计算机视觉与模式识别
2026-05-06 v1
摘要
多模态视觉对象跟踪可分为多种任务(例如RGB和RGB+X跟踪),现有方法常为每个模态单独训练模型,或依赖预训练模型适应新模态,这限制了效率、可扩展性和可用性。因此,我们引入OneTrackerV2,一个统一的多模态跟踪框架,支持任意模态的端到端训练。我们提出Meta Merger,将多模态信息嵌入统一空间,实现灵活的模态融合和鲁棒性。进一步引入双Mixture-of-Experts(DMoE):T-MoE建模跟踪的时空关系,M-MoE嵌入多模态知识,解耦跨模态依赖,减少特征冲突。采用共享架构、统一参数和单一端到端训练,OneTrackerV2在五个RGB和RGB+X跟踪任务及12个基准测试中实现了最佳性能,同时保持高推理效率。值得注意的是,OneTrackerV2在模型压缩后仍保持强大的性能。此外,OneTrackerV2在模态缺失场景下表现出卓越的鲁棒性。
引用
@article{arxiv.2605.03716,
title = {Unified Multimodal Visual Tracking with Dual Mixture-of-Experts},
author = {Lingyi Hong and Jinglun Li and Xinyu Zhou and Kaixun Jiang and Pinxue Guo and Zhaoyu Chen and Runze Li and Xingdong Sheng and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2605.03716},
year = {2026}
}
备注
OneTrackerV2. Accepted by ICML 2026