基于演讲者定位的多阶段人脸-语音关联学习框架
音频与语音处理
2024-07-26 v1
摘要
人类大脑能够通过利用人与人之间普遍关系,将未知个体的语音与面部特征关联起来,这一任务称为“跨模态说话人验证”。本任务由于语音与面部特征之间复杂的关系,面临着显著的挑战。本文提出了一种“基于演讲者定位的多阶段人脸-语音关联学习”(MFV-KSD)框架。MFV-KSD包含一个演讲者定位前端,以有效解决噪声语音输入问题。为平衡和增强单模态特征学习与跨模态相关性理解,MFV-KSD采用了一种新颖的三阶段训练策略。我们的实验结果表明,方法性能稳健,在2024年面向多语言环境的人脸-语音关联挑战赛(FAME)中获得了第一名,总体平等错误率(EER)为19.9%。详情请参见https://github.com/TaoRuijie/MFV-KSD。
引用
@article{arxiv.2407.17902,
title = {Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization},
author = {Ruijie Tao and Zhan Shi and Yidi Jiang and Duc-Tuan Truong and Eng-Siong Chng and Massimo Alioto and Haizhou Li},
journal= {arXiv preprint arXiv:2407.17902},
year = {2024}
}