基于锐度感知优化的多数据集协同训练用于音频反欺骗
声音
2023-06-02 v2 机器学习
音频与语音处理
摘要
面向自动说话人验证的音频反欺骗旨在保护用户身份免受欺骗攻击。尽管最先进的欺骗对抗措施(CM)模型在特定数据集上表现良好,但在跨数据集评估时缺乏泛化能力。为应对此局限,先前研究探索了大型预训练模型,但其需要大量资源与时间。我们旨在开发一个紧凑但泛化良好的CM模型,以与大型预训练模型竞争。我们的方法涉及多数据集协同训练与锐度感知最小化,该组合在此领域尚未被研究。大量实验表明,所提方法在各数据集上取得了有竞争力的结果,同时参数量比大型预训练模型少4000倍。
引用
@article{arxiv.2305.19953,
title = {Multi-Dataset Co-Training with Sharpness-Aware Optimization for Audio Anti-spoofing},
author = {Hye-jin Shim and Jee-weon Jung and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2305.19953},
year = {2023}
}
备注
Interspeech 2023