中文

合成语音检测中的跨技术泛化:评估现代语音生成器的 AST 模型

声音 2025-03-31 v1 密码学与安全 音频与语音处理

摘要

本文评估了 Audio Spectrogram Transformer (AST) 架构用于合成语音检测,侧重于跨现代语音生成技术的泛化。在采用不同数据增强策略后,模型在测试 ElevenLabs、NotebookLM 和 Minimax AI 语音生成器时实现了 0.91% 的整体错误等效率 (EER)。值得注意的是,在仅使用单一技术的 102 个样本进行训练的情况下,该模型对完全未出现的语音生成器实现了 3.3% 的 EER。这项工作为快速适应新兴合成技术提供了基准,并提供了基于转换器架构可识别不同神经语音合成方法中常见伪影的证据,从而为更健壮的语音验证系统做出贡献。

关键词

引用

@article{arxiv.2503.22503,
  title  = {Cross-Technology Generalization in Synthesized Speech Detection: Evaluating AST Models with Modern Voice Generators},
  author = {Andrew Ustinov and Matey Yordanov and Andrei Kuchma and Mikhail Bychkov},
  journal= {arXiv preprint arXiv:2503.22503},
  year   = {2025}
}

备注

10 pages, 5 figures