中文

2018 语音转换挑战的欺骗基准:利用欺骗对策进行语音伪迹评估

音频与语音处理 2018-09-05 v2 计算与语言 声音 机器学习

摘要

语音转换(VC)旨在不改变内容的前提下转换说话人特征。由于训练数据限制与建模缺陷,难以在不引入处理伪迹的情况下实现可信的说话人模仿;因此 VC 的性能评估通常需由人工小组进行说话人相似度与质量评价。作为耗时、昂贵且不可复现的过程,它阻碍了新 VC 技术的快速原型开发。我们利用先前针对自动说话人验证的欺骗对策(CMs)相关工作,以客观的替代方法进行伪迹评估。其中 CMs 用于拒绝重放、合成或转换语音等“伪造”输入,但其在自动语音伪迹评估中的潜力尚属未知。本研究旨在填补该空白。作为 2018 语音转换挑战(VCC'18)数据主观结果的补充,我们配置标准恒定 Q 倒谱系数 CM 来量化处理伪迹程度。CM 的等错误率(EER)——即 VC 样本与人类真实语音的混淆指数——作为我们的伪迹度量。我们识别出两类 VCC'18 参赛系统:具有可检测伪迹的低质量系统(低 EER),以及伪迹较少的较高质量系统。然而,所有 VCC'18 系统均非完美:所有 EER 均 < 30%(“理想”值应为 50%)。我们的初步结果表明,CMs 在其原始应用之外具有潜力,可作为补充优化与基准工具以提升 VC 技术。

关键词

引用

@article{arxiv.1804.08438,
  title  = {A Spoofing Benchmark for the 2018 Voice Conversion Challenge: Leveraging from Spoofing Countermeasures for Speech Artifact Assessment},
  author = {Tomi Kinnunen and Jaime Lorenzo-Trueba and Junichi Yamagishi and Tomoki Toda and Daisuke Saito and Fernando Villavicencio and Zhenhua Ling},
  journal= {arXiv preprint arXiv:1804.08438},
  year   = {2018}
}

备注

Correction (bug fix) of a published ODYSSEY 2018 publication with the same title and author list; more details in footnote in page 1