用于多模态融合的分层Delta-注意力方法
计算机视觉与模式识别
2022-11-29 v2 计算与语言
机器学习
摘要
在视觉与语言学中,主要的输入模态为面部表情、语音模式以及所说出的词语。分析任一表达模式(视觉、言语或声音)的问题在于大量上下文信息可能丢失。这要求研究者审视多种模态,以透彻理解情境的跨模态依赖与时间上下文,从而分析表达。本工作试图保留不同模态内部及之间的长程依赖,这类依赖会因循环网络的使用而受限,并引入delta-注意力概念以聚焦于各模态的局部差异,从而捕捉不同个体的特异性。我们探索一种交叉注意力融合技术,以获取通过这些delta自注意力模态所表达情感的整体视图,从而将全部局部细微特征与全局上下文融合在一起。注意力的引入在多模态融合领域尚属新颖,且当前正在审视注意力机制应使用的阶段;本工作取得了接近当前SOTA的总体与逐类分类准确率,且参数量几乎为其一半。
引用
@article{arxiv.2011.10916,
title = {Hierachical Delta-Attention Method for Multimodal Fusion},
author = {Kunjal Panchal},
journal= {arXiv preprint arXiv:2011.10916},
year = {2022}
}
备注
Need to update the results