音视频验证系统的自动质量评估:LOVe 对 NIST SRE 2019 挑战赛的提交
音频与语音处理
2020-08-17 v2 多媒体
声音
摘要
分数融合是由独立单模态部分组成的多模态生物识别系统的基石。在本工作中,我们关注说话人-人脸验证中依赖于质量的融合。为此,我们提出了一种可训练用于人脸与说话人两种模态自动质量评估的通用模型。该模型估计单模态系统所产生表征的质量,进而用于增强说话人与人脸验证模块的分数级融合。我们在近期的 NIST SRE19 音视频挑战赛数据集上展示了这种依赖于质量的融合带来的改进。
引用
@article{arxiv.2008.05889,
title = {Automatic Quality Assessment for Audio-Visual Verification Systems. The LOVe submission to NIST SRE Challenge 2019},
author = {Grigory Antipov and Nicolas Gengembre and Olivier Le Blouch and Gaël Le Lan},
journal= {arXiv preprint arXiv:2008.05889},
year = {2020}
}
备注
5 pages, 1 figure, accepted at INTERSPEECH 2020. Corrected the reference [20]