用于视听人物验证的动态交叉注意力
计算机视觉与模式识别
2024-04-23 v3 机器学习
声音
音频与语音处理
摘要
尽管人物或身份验证主要使用面部和声音等单一模态进行探索,但视听融合最近展现出了超越单模态方法的巨大潜力。音频和视觉模态通常被认为具有强互补关系,这在有效的视听融合中起着至关重要的作用。然而,它们并不总是强互补的,也可能表现出弱互补关系,从而导致较差的视听特征表示。在本文中,我们提出了一种动态交叉注意力(DCA)模型,该模型能够根据音频和视觉模态之间存在的强或弱互补关系,动态地即时选择交叉注意或非注意特征。具体而言,设计了一个条件门控层来评估交叉注意力机制的贡献,并仅在它们表现出强互补关系时选择交叉注意特征,否则选择非注意特征。在 Voxceleb1 数据集上进行了大量实验以证明所提出模型的鲁棒性。结果表明,所提出的模型在交叉注意力的多个变体上均持续提升性能,同时优于现有最先进方法。
引用
@article{arxiv.2403.04661,
title = {Dynamic Cross Attention for Audio-Visual Person Verification},
author = {R. Gnana Praveen and Jahangir Alam},
journal= {arXiv preprint arXiv:2403.04661},
year = {2024}
}
备注
Accepted to FG2024