人类与机器中的说话人判别:说话风格多变性的影响
音频与语音处理
2020-08-11 v1 机器学习
信号处理
摘要
说话风格的变化是否会影响人类通过嗓音区分个体的能力?人类与专为判别嗓音而设计的自动系统相比表现如何?在本文中,我们尝试通过比较人类与机器在朗读语音与随意对话上的说话人判别表现来回答这些问题。三十名听者被要求完成同一说话人与不同说话人的判别任务。他们的表现与一个最先进的基于 x-vector/PLDA 的自动说话人验证系统进行了比较。结果表明,人类和机器在使用风格匹配的刺激时表现均更好,且当听者为美式英语母语者时人类表现更佳。在风格匹配条件下,母语听者表现优于机器(朗读语音的 EER 分别为 6.96% 与 14.35%,对话分别为 15.12% 与 19.87%),但在风格不匹配条件下,母语听者与机器之间无显著差异。在所有条件下,将人类响应与机器结果相融合均比单独使用任一方有所改善,表明人类与机器在说话人判别任务上采用不同方法。通过考察各说话人的结果进一步证实了方法差异,显示人类听者与机器对区分度高与易混淆说话人的感知不同。
引用
@article{arxiv.2008.03617,
title = {Speaker discrimination in humans and machines: Effects of speaking style variability},
author = {Amber Afshan and Jody Kreiman and Abeer Alwan},
journal= {arXiv preprint arXiv:2008.03617},
year = {2020}
}
备注
Accepted to Interspeech 2020