中文

基于整体标记学习的多模态专家混合框架用于细粒度驾驶员动作识别多模态视觉分析

计算机视觉与模式识别 2026-04-08 v1

摘要

当异构模态为决策提供互补但输入依赖的证据时,鲁棒的 multimodal visual analytics 仍然具有挑战性。现有的多模态学习方法主要依赖固定融合模块或预定义的跨模态交互,这些方法往往不足以适应变化的模态可靠性,也不足以捕捉细粒度的动作线索。为此,我们提出了一个结合整体标记学习 (HTL) 策略的多模态专家混合 (MoME) 框架。MoME 实现了模态特定专家之间的自适应协作,而 HTL 通过类别标记和时空标记同时改进了专家内部细化和专家间知识传递。通过这种方式,我们的方法形成了一个以知识为中心的多模态学习框架,在提升专家特化能力的同时减少了多模态融合中的歧义。我们在驾驶员动作识别这一代表性多模态理解任务上验证了所提出的框架。公共基准上的实验结果表明,所提出的 MoME 框架和 HTL 策略联合优于代表性的单模态和多模态基线。额外的消融实验、验证和可视化结果进一步验证了所提出的 HTL 策略改善了细微的多模态理解并提供了更好的可解释性。

关键词

引用

@article{arxiv.2604.05947,
  title  = {Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition},
  author = {Tianyi Liu and Yiming Li and Wenqian Wang and Jiaojiao Wang and Chen Cai and Yi Wang and Kim-Hui Yap},
  journal= {arXiv preprint arXiv:2604.05947},
  year   = {2026}
}

备注

11 pages, 3 figures