中文

用于合成语音检测的参数高效多尺度卷积适配器

声音 2025-10-30 v1

摘要

近期的合成语音检测模型通常通过微调预训练的SSL模型,这在计算上具有较大的要求。参数高效微调(PEFT)提供了一种替代方案。然而,现有方法缺乏针对仿冒音频所特有的多尺度时序瑕疵所必需的特定归纳偏置。这篇论文引入了Multi-Scale Convolutional Adapter (MultiConvAdapter),一种旨在解决这一局限性的参数高效架构。MultiConvAdapter将并行卷积模块集成到SSL编码器中,促进在多个时间分辨率上学习判别性特征,同时捕获短期瑕疵和长期失真。仅需3.17M可训练参数(SSL主干网络的1%),MultiConvAdapter大大减少了适应的计算负担。在五个公开数据集上的评估表明,MultiConvAdapter的性能优于完全微调和已建立的PEFT方法。

关键词

引用

@article{arxiv.2510.24852,
  title  = {A Parameter-Efficient Multi-Scale Convolutional Adapter for Synthetic Speech Detection},
  author = {Yassine El Kheir and Fabian Ritter-Guttierez and Arnab Das and Tim Polzehl and Sebastian Möller},
  journal= {arXiv preprint arXiv:2510.24852},
  year   = {2025}
}

备注

6 pages