中文

基于跨模态关系和层次互动注意力的多模态-多任务框架用于语义理解

计算机视觉与模式识别 2025-08-25 v1 人工智能

摘要

多模态学习的主要挑战之一是单个模态内存在噪声。这类噪声本质上会影响最终的多模态表示,尤其是当这些表示通过不同模态之间的显式交互获得时。此外,虽然寻求实现强联合表示的多模态融合技术,却可能忽视单个模态中有价值的判别性信息。为此,我们提出一种多模态-多任务框架,具备crOss-modal Relation和hIErarchical iNteractive aTtention(MM-ORIENT),适用于多个任务。该方法通过跨模态方式获取多模态表示,而无需在不同模态之间进行显式交互,从而在潜在阶段减少噪声效应。为此,我们提出了跨模态关系图,对单模态特征进行重构以获取多模态表示。该重构基于节点邻域进行,邻域由不同模态的特征决定。我们还提出了层次互动单模态注意力(HIMA),以聚焦于单个模态的 pertinent 信息。在跨模态关系图帮助理解两个模态之间的高阶关系方面,HIMA通过学习单个模态的判别性特征来实现多任务,随后进行晚期融合。最后,在三个数据集上进行了大量实验,表明该方法有效地为多个任务理解多模态内容。

关键词

引用

@article{arxiv.2508.16300,
  title  = {A Multimodal-Multitask Framework with Cross-modal Relation and Hierarchical Interactive Attention for Semantic Comprehension},
  author = {Mohammad Zia Ur Rehman and Devraj Raghuvanshi and Umang Jain and Shubhi Bansal and Nagendra Kumar},
  journal= {arXiv preprint arXiv:2508.16300},
  year   = {2025}
}

备注

Published in Information Fusion