基于差异最小化的跨域自适应用于文本无关法庭说话人验证
音频与语音处理
2020-09-10 v2 机器学习
声音
摘要
由于参考录音与自然现场录音之间位置/场景的不确定性和多样性失配,用于说话人验证的法庭音频分析具有独特挑战。缺乏具有真实说话人身份的天然法庭音频语料库是该领域的主要挑战。由于域失配和性能损失,也难以直接采用小规模特定域数据训练复杂神经网络架构。另一方面,面向多种声学环境的跨域说话人验证是一项具有挑战性的任务,可推进音频法庭科学的研究。在本研究中,我们引入了在多种声学环境下收集的CRSS-Forensics音频数据集。我们使用VoxCeleb数据预训练基于CNN的网络,随后采用一种方法利用CRSS-Forensics的干净语音微调高层网络部分层。基于此微调模型,我们通过差异损失和最大均值差异(MMD)在嵌入空间中对齐特定域分布。这在干净集上保持有效性能的同时,将模型泛化到其他声学域。从结果中我们表明,多样的声学环境影响说话人验证性能,且我们提出的跨域自适应方法可在此场景下显著改善结果。
引用
@article{arxiv.2009.02444,
title = {Cross-domain Adaptation with Discrepancy Minimization for Text-independent Forensic Speaker Verification},
author = {Zhenyu Wang and Wei Xia and John H. L. Hansen},
journal= {arXiv preprint arXiv:2009.02444},
year = {2020}
}
备注
To appear in INTERSPEECH 2020