针对自动说话人验证的常数 Q 倒谱系数反欺骗对策的可解释性研究
音频与语音处理
2020-04-21 v3 声音
摘要
自动说话人验证的反欺骗现已是一个成熟的研究领域,过去 6 年中已举办三届竞争性挑战赛。在此期间大量研究工作投入到专为欺骗检测任务设计的前端表征开发上。其中一种称为常数 Q 倒谱系数(CQCCs)的方法,在检测基于单元选择语音合成算法实现的攻击时尤为有效。尽管取得成功,它们在检测其他形式欺骗攻击时大体失效,而更传统的前端表征则给出明显更优的结果。在最近的 2019 年版 ASVspoof 挑战赛中也观察到了类似差异。本文报告了我们为解释这些观测所做的尝试。解释表明其原因在于各前端对频谱不同子带分量的关注程度。迄今为止,关于反欺骗对策究竟检测到了何种伪影,人们所知甚少。因此,我们的工作旨在阐明可用于区分不同形式欺骗攻击与真实、合法语音的信号或频谱级伪影。更好理解这些伪影,我们将更有能力设计更可靠的计数器措施。
引用
@article{arxiv.2004.06422,
title = {An explainability study of the constant Q cepstral coefficient spoofing countermeasure for automatic speaker verification},
author = {Hemlata Tak and Jose Patino and Andreas Nautsch and Nicholas Evans and Massimiliano Todisco},
journal= {arXiv preprint arXiv:2004.06422},
year = {2020}
}
备注
Accepted to Speaker Odyssey (The Speaker and Language Recognition Workshop), 2020, 8 pages