中文

用于多模态融合的分层Delta-注意力方法

计算机视觉与模式识别 2022-11-29 v2 计算与语言 机器学习

摘要

在视觉与语言学中,主要的输入模态为面部表情、语音模式以及所说出的词语。分析任一表达模式(视觉、言语或声音)的问题在于大量上下文信息可能丢失。这要求研究者审视多种模态,以透彻理解情境的跨模态依赖与时间上下文,从而分析表达。本工作试图保留不同模态内部及之间的长程依赖,这类依赖会因循环网络的使用而受限,并引入delta-注意力概念以聚焦于各模态的局部差异,从而捕捉不同个体的特异性。我们探索一种交叉注意力融合技术,以获取通过这些delta自注意力模态所表达情感的整体视图,从而将全部局部细微特征与全局上下文融合在一起。注意力的引入在多模态融合领域尚属新颖,且当前正在审视注意力机制应使用的阶段;本工作取得了接近当前SOTA的总体与逐类分类准确率,且参数量几乎为其一半。

关键词

引用

@article{arxiv.2011.10916,
  title  = {Hierachical Delta-Attention Method for Multimodal Fusion},
  author = {Kunjal Panchal},
  journal= {arXiv preprint arXiv:2011.10916},
  year   = {2022}
}

备注

Need to update the results