基于跨模态关系和层次互动注意力的多模态-多任务框架用于语义理解
计算机视觉与模式识别
2025-08-25 v1 人工智能
摘要
多模态学习的主要挑战之一是单个模态内存在噪声。这类噪声本质上会影响最终的多模态表示,尤其是当这些表示通过不同模态之间的显式交互获得时。此外,虽然寻求实现强联合表示的多模态融合技术,却可能忽视单个模态中有价值的判别性信息。为此,我们提出一种多模态-多任务框架,具备crOss-modal Relation和hIErarchical iNteractive aTtention(MM-ORIENT),适用于多个任务。该方法通过跨模态方式获取多模态表示,而无需在不同模态之间进行显式交互,从而在潜在阶段减少噪声效应。为此,我们提出了跨模态关系图,对单模态特征进行重构以获取多模态表示。该重构基于节点邻域进行,邻域由不同模态的特征决定。我们还提出了层次互动单模态注意力(HIMA),以聚焦于单个模态的 pertinent 信息。在跨模态关系图帮助理解两个模态之间的高阶关系方面,HIMA通过学习单个模态的判别性特征来实现多任务,随后进行晚期融合。最后,在三个数据集上进行了大量实验,表明该方法有效地为多个任务理解多模态内容。
引用
@article{arxiv.2508.16300,
title = {A Multimodal-Multitask Framework with Cross-modal Relation and Hierarchical Interactive Attention for Semantic Comprehension},
author = {Mohammad Zia Ur Rehman and Devraj Raghuvanshi and Umang Jain and Shubhi Bansal and Nagendra Kumar},
journal= {arXiv preprint arXiv:2508.16300},
year = {2025}
}
备注
Published in Information Fusion