中文

面向音频克隆检测的注意力基对比学习

声音 2024-07-08 v1 人工智能 音频与语音处理

摘要

视觉转换器(ViT)已在计算机视觉中的分类任务中取得显著进展。最近,Gong等人于2021年引入了注意力建模用于多个音频任务。然而,使用ViT用于音频克隆检测任务的研究相对有限。我们填补了这一差距,首次将ViT应用于此任务。基于对SSAST(Gong等人,2022)音频ViT模型的微调构建的基础基线实现次优的等错误率(EER)。为提升性能,我们提出了一种新颖的注意力基对比学习框架(SSAST-CL),使用跨注意力辅助表征学习。实验表明,我们的框架成功地将bonafide和spoof类别区分开来,有助于学习该任务的更好分类器。在合适的数据增强策略下,在我们的框架上训练的模型在ASVSpoof 2021挑战赛中实现了具竞争力的性能。我们提供比较和消融研究以证明我们的主张。

关键词

引用

@article{arxiv.2407.03514,
  title  = {Towards Attention-based Contrastive Learning for Audio Spoof Detection},
  author = {Chirag Goel and Surya Koppisetti and Ben Colman and Ali Shahriyari and Gaurav Bharaj},
  journal= {arXiv preprint arXiv:2407.03514},
  year   = {2024}
}

备注

Proc. INTERSPEECH 2023