从人类感知中学习以改善风格失配条件下的自动说话人验证
音频与语音处理
2022-06-29 v1 机器学习
摘要
我们先前的实验表明,人类与机器似乎采用不同的说话人判别方法,尤其在存在说话风格的变异性时。实验考察了朗读语音与对话语音。听者在“将说话人判为同一”时关注说话人特定的习惯特征,而在“将说话人区分开”时关注共享声学空间中的相对距离。然而,自动说话人验证(ASV)系统无论目标还是非目标试验均使用相同的损失函数。为改善存在风格变异性时的 ASV 性能,利用从人类感知中学到的见解设计了一种新的训练损失函数,我们称之为“CllrCE loss”。CllrCE loss 同时使用说话人特定的习惯特征和说话人间的相对声学距离来训练 ASV 系统。在使用 UCLA 说话人变异性数据库时,在 x-vector 和 conditioning 设置下,与 x-vector 基线相比,CllrCE loss 使 EER 相对改善 1-66%,minDCF 分别相对改善 1-31% 和 1-56%。使用涉及不同对话语音任务的 SITW 评测任务时,所提损失结合自注意力 conditioning 相较基线在 EER 上相对改善 2-5%、minDCF 上相对改善 6-12%。在 SITW 情况下,性能改善仅在 conditioning 下一致。
引用
@article{arxiv.2206.13684,
title = {Learning from human perception to improve automatic speaker verification in style-mismatched conditions},
author = {Amber Afshan and Abeer Alwan},
journal= {arXiv preprint arXiv:2206.13684},
year = {2022}
}
备注
To appear in Interspeech, 2022