中文

面向真实场景下人物验证的视听嵌入学习

计算机视觉与模式识别 2022-10-27 v2 多媒体 声音 音频与语音处理

摘要

已有观察表明,在人物验证中,视听嵌入比单模态嵌入更为鲁棒。本文提出了一种从融合视角考虑聚合器的新型视听策略。首先,我们首次在人脸验证中引入权重增强的注意力统计池化。我们发现池化过程中各模态之间存在强相关性,因此提出了包含循环一致性的联合注意力池化以学习隐式帧间权重。最后,各模态通过门控注意力机制融合以获得鲁棒的视听嵌入。所有提出的模型均在 VoxCeleb2 dev 数据集上训练,最佳系统在 VoxCeleb1 的三个官方试验列表上分别取得 0.18%、0.27% 和 0.49% 的 EER,据我们所知这是人物验证领域已发表的最佳结果。

关键词

引用

@article{arxiv.2209.04093,
  title  = {Learning Audio-Visual embedding for Person Verification in the Wild},
  author = {Peiwen Sun and Shanshan Zhang and Zishan Liu and Yougen Yuan and Taotao Zhang and Honggang Zhang and Pengfei Hu},
  journal= {arXiv preprint arXiv:2209.04093},
  year   = {2022}
}