基于主动学习的训练数据选择用于语音欺骗反制的探究
音频与语音处理
2022-10-10 v3
摘要
训练一个能泛化到各种未见数据的欺骗反制 (CM) 系统是期望但具有挑战性的。尽管数据增强与自监督学习等方法可用,但在多样化测试集上不完美的 CM 性能仍需要额外策略。本研究率先使用主动学习 (AL) 进行 CM 训练,AL 是一种从大型池集迭代选择有用数据并微调 CM 的框架。本研究比较了几种衡量数据有用性的方法,以及使用从不同来源收集的不同池集的影响。结果表明,基于 AL 的 CM 在多个测试集上比我们的强基线取得了更好的泛化性。此外,与直接使用整个数据池集训练的自上基线 CM 相比,基于 AL 的 CM 以更少的训练数据取得了相似性能。尽管未找到 AL 的单一最佳配置,经验法则是池集中应包含多样的欺骗与真实数据,并避免使用任何选择 CM 已有把握数据的 AL 数据选择方法。
引用
@article{arxiv.2203.14553,
title = {Investigating Active-learning-based Training Data Selection for Speech Spoofing Countermeasure},
author = {Xin Wang and Junich Yamagishi},
journal= {arXiv preprint arXiv:2203.14553},
year = {2022}
}
备注
To appear in Proc. SLT 2022, modified based on a paper rejected by Interspeech 2022