语音为银,静默为金:ASVspoof 训练的模型究竟学到了什么?
声音
2021-09-29 v4 音频与语音处理
摘要
我们呈现对官方 2019/2021 ASVspoof 挑战数据集中显著数据伪影的分析。我们识别出训练集与测试集中静默时长分布的不均衡,其倾向于与目标预测标签相关。真实(bonafide)实例往往比伪造(spoofed)实例具有显著更长的首尾静默。本文中我们深入探究此现象及其影响。我们比较了在 a) 仅首部静默时长和 b) 仅首部与尾部静默时长上训练的几种模型。结果表明,仅在首部静默时长上训练的模型表现尤为良好,达到高达 85% 的准确率和 15.1% 的等错误率(EER)。同时,我们观察到在预处理中裁剪静默、随后使用基于信号的特征训练既有反欺骗模型会导致相对更差的性能。该情况下,EER 从 3.6%(含静默)上升到 15.5%(裁剪静默)。我们的发现表明,先前的工作可能部分无意中通过依赖官方挑战数据集中出现的静默时长来学习伪造/真实区分。我们讨论了这对解释挑战中系统评分的潜在后果,并探讨 ASV 社区可如何进一步考量此问题。
引用
@article{arxiv.2106.12914,
title = {Speech is Silver, Silence is Golden: What do ASVspoof-trained Models Really Learn?},
author = {Nicolas M. Müller and Franziska Dieckmann and Pavel Czempin and Roman Canals and Konstantin Böttinger and Jennifer Williams},
journal= {arXiv preprint arXiv:2106.12914},
year = {2021}
}