包容性说话人验证评估数据集的设计准则
音频与语音处理
2022-09-14 v2 计算机与社会
机器学习
摘要
说话人验证(SV)为数十亿语音设备提供访问控制,并保障语音驱动技术的安全。作为一种生物特征识别技术,SV 必须无偏,对不同人口统计、社会与经济属性的说话人均保持一致可靠的性能。当前的 SV 评估实践不足以评估偏差:它们过于简化且将用户聚合,不能代表真实使用场景,且未考虑错误的后果。本文提出构建 SV 评估数据集的设计准则以弥补这些不足。我们提出一种对语句对难度分级的模式,并给出生成包容性 SV 数据集的算法。我们在 VoxCeleb1 数据集上通过一组实验对所提方法进行了经验验证。结果证实,每说话人的语句对数量以及语句对的难度分级对评估性能与变异性有显著影响。我们的工作有助于发展包容且公平的 SV 评估实践。
引用
@article{arxiv.2204.02281,
title = {Design Guidelines for Inclusive Speaker Verification Evaluation Datasets},
author = {Wiebke Toussaint Hutiri and Lauriane Gorce and Aaron Yi Ding},
journal= {arXiv preprint arXiv:2204.02281},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022 (submitted version)