面向真实场景下人物验证的视听嵌入学习
计算机视觉与模式识别
2022-10-27 v2 多媒体
声音
音频与语音处理
摘要
已有观察表明,在人物验证中,视听嵌入比单模态嵌入更为鲁棒。本文提出了一种从融合视角考虑聚合器的新型视听策略。首先,我们首次在人脸验证中引入权重增强的注意力统计池化。我们发现池化过程中各模态之间存在强相关性,因此提出了包含循环一致性的联合注意力池化以学习隐式帧间权重。最后,各模态通过门控注意力机制融合以获得鲁棒的视听嵌入。所有提出的模型均在 VoxCeleb2 dev 数据集上训练,最佳系统在 VoxCeleb1 的三个官方试验列表上分别取得 0.18%、0.27% 和 0.49% 的 EER,据我们所知这是人物验证领域已发表的最佳结果。
引用
@article{arxiv.2209.04093,
title = {Learning Audio-Visual embedding for Person Verification in the Wild},
author = {Peiwen Sun and Shanshan Zhang and Zishan Liu and Yougen Yuan and Taotao Zhang and Honggang Zhang and Pengfei Hu},
journal= {arXiv preprint arXiv:2209.04093},
year = {2022}
}