Co-AttenDWG:面向多模态辱骚内容检测的共注意力维度级门控与专家融合
计算机视觉与模式识别
2025-07-31 v2 计算与语言
摘要
多模态学习已成为重要研究方向,因为整合文本和视觉信息可显著提升分类、检索和场景理解等任务中的性能。尽管大型预训练模型取得了进展,现有方法常 suffers from 跨模态交互不足和僵化的融合策略,未能充分发挥不同模态的互补优势。为此,我们提出 Co-AttenDWG,集成共注意力维度级门控与专家融合。我们的 approach 首先将文本和视觉特征投影到共享嵌入空间,在该空间中,专门设计的共注意力机制实现模态间的同时、细粒度交互。随后,通过维度级门控网络自适应调制特征贡献,以强调关键信息。并行地,双路径编码器独立细化模态特定表征,同时添加额外的跨注意力层进一步对齐模态。最终,所得特征通过包含学习门控和自注意力的 expert fusion 模块集成,生成稳健的统一表征。在 MIMIC 和 SemEval Memotion 1.0 数据集上的实验结果表明,Co-AttenDWG 实现了最先进的性能和优异的跨模态对齐,凸显其在多样化多模态应用中的有效性。
引用
@article{arxiv.2505.19010,
title = {Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection},
author = {Md. Mithun Hossain and Md. Shakil Hossain and Sudipto Chaki and M. F. Mridha},
journal= {arXiv preprint arXiv:2505.19010},
year = {2025}
}