中文

MVCL-DAF++: 通过原型感知对比对齐和粗到细动态注意力融合提升多模态意图识别

机器学习 2025-09-24 v2 人工智能

摘要

多模态意图识别 (MMIR) 面临着弱语义对齐和在噪声或少数类条件下鲁棒性差的问题。我们提出 MVCL-DAF++,通过两大模块扩展 MVCL-DAF:(1) 原型感知对比对齐,将实例对齐到类别级原型以增强语义一致性;(2) 粗到细注意力融合,将全局模态摘要与 token 级别特征集成,用于层次化跨模态交互。在 MIntRec 和 MIntRec2.0 上,MVCL-DAF++ 实现了新的状态-of-the-art 成绩,分别将稀有类识别 WF1 提升了 +1.05% 和 +4.18%。这些结果表明,原型引导学习和粗到细融合对稳健的多模态理解具有有效性。源码已公开于 https://github.com/chr1s623/MVCL-DAF-PlusPlus。

关键词

引用

@article{arxiv.2509.17446,
  title  = {MVCL-DAF++: Enhancing Multimodal Intent Recognition via Prototype-Aware Contrastive Alignment and Coarse-to-Fine Dynamic Attention Fusion},
  author = {Haofeng Huang and Yifei Han and Long Zhang and Bin Li and Yangfan He},
  journal= {arXiv preprint arXiv:2509.17446},
  year   = {2025}
}

备注

Submitted to ICASSP 2026