中文

基于锐度感知优化的多数据集协同训练用于音频反欺骗

声音 2023-06-02 v2 机器学习 音频与语音处理

摘要

面向自动说话人验证的音频反欺骗旨在保护用户身份免受欺骗攻击。尽管最先进的欺骗对抗措施(CM)模型在特定数据集上表现良好,但在跨数据集评估时缺乏泛化能力。为应对此局限,先前研究探索了大型预训练模型,但其需要大量资源与时间。我们旨在开发一个紧凑但泛化良好的CM模型,以与大型预训练模型竞争。我们的方法涉及多数据集协同训练与锐度感知最小化,该组合在此领域尚未被研究。大量实验表明,所提方法在各数据集上取得了有竞争力的结果,同时参数量比大型预训练模型少4000倍。

关键词

引用

@article{arxiv.2305.19953,
  title  = {Multi-Dataset Co-Training with Sharpness-Aware Optimization for Audio Anti-spoofing},
  author = {Hye-jin Shim and Jee-weon Jung and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2305.19953},
  year   = {2023}
}

备注

Interspeech 2023