中文

ASVspoof 2019:一个大规模的合成、转换与重放语音公开数据库

音频与语音处理 2020-07-15 v4 密码学与安全 声音 信号处理

摘要

自动说话人验证(ASV)是最自然、最便捷的生物学特征个人识别手段之一。不幸的是,正如所有其他生物识别系统一样,ASV易受欺骗,亦称为“呈现攻击”。这些漏洞通常不可接受,因而需要欺骗对策或“呈现攻击检测”系统。除冒充外,ASV系统还易受重放、语音合成和语音转换攻击。ASVspoof 2019版本是首个在单一挑战中同时考虑全部三种欺骗攻击类型的版本。尽管它们源自同一源数据库和相同底层协议,但在两种特定用例场景中进行了探究。逻辑访问(LA)场景中的欺骗攻击采用最新语音合成与语音转换技术生成,包括最先进的神经声学与波形模型技术。物理访问(PA)场景中的重放欺骗攻击通过精心控制的仿真生成,可支持比以往更为揭示性的分析。2019版本的另一新特点是采用串联检测代价函数度量,其反映了欺骗与对策对固定ASV系统可靠性的影响。本文描述了数据库设计、协议、欺骗攻击实现以及基线ASV与对策结果。还描述了针对逻辑访问中欺骗数据的人工评估。结果表明,ASVspoof 2019数据库中的欺骗数据具有不同程度的可感知质量及与目标说话人的相似度,包括即便人工受试者亦无法与真实语音区分的欺骗数据。

关键词

引用

@article{arxiv.1911.01601,
  title  = {ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech},
  author = {Xin Wang and Junichi Yamagishi and Massimiliano Todisco and Hector Delgado and Andreas Nautsch and Nicholas Evans and Md Sahidullah and Ville Vestman and Tomi Kinnunen and Kong Aik Lee and Lauri Juvela and Paavo Alku and Yu-Huai Peng and Hsin-Te Hwang and Yu Tsao and Hsin-Min Wang and Sebastien Le Maguer and Markus Becker and Fergus Henderson and Rob Clark and Yu Zhang and Quan Wang and Ye Jia and Kai Onuma and Koji Mushika and Takashi Kaneda and Yuan Jiang and Li-Juan Liu and Yi-Chiao Wu and Wen-Chin Huang and Tomoki Toda and Kou Tanaka and Hirokazu Kameoka and Ingmar Steiner and Driss Matrouf and Jean-Francois Bonastre and Avashna Govender and Srikanth Ronanki and Jing-Xuan Zhang and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:1911.01601},
  year   = {2020}
}

备注

Accepted, Computer Speech and Language. This manuscript version is made available under the CC-BY-NC-ND 4.0. For the published version on Elsevier website, please visit https://doi.org/10.1016/j.csl.2020.101114