中文

基于联合交叉注意力递归融合的视听人员验证

计算机视觉与模式识别 2024-04-29 v3 声音 音频与语音处理

摘要

由于人脸和声音之间存在紧密关联,利用视听融合进行人员或身份验证近期受到了广泛关注。基于视听融合的传统方法依赖于分数级或早期特征级融合技术。尽管现有方法相比单模态系统有所改进,但视听融合在人员验证中的潜力尚未被完全挖掘。在本文中,我们研究了有效捕获音频和视觉模态间模内与模间关系的前景,这对于显著提升融合性能优于单模态系统起着至关重要的作用。具体而言,我们引入了联合交叉注意力模型的递归融合,其中联合视听特征表示以递归方式应用于交叉注意力框架中,以逐步细化特征表示,从而高效捕获模内与模间关系。为了进一步增强视听特征表示,我们还探索了 BLSTM 以改善视听特征表示的时序建模。我们在 Voxceleb1 数据集上进行了大量实验以评估所提出的模型。结果表明,所提出的模型通过巧妙捕获音频和视觉模态间的模内与模间关系,在融合性能上展现出显著的提升。

关键词

引用

@article{arxiv.2403.04654,
  title  = {Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention},
  author = {R. Gnana Praveen and Jahangir Alam},
  journal= {arXiv preprint arXiv:2403.04654},
  year   = {2024}
}

备注

Accepted to FG2024