更难还是不同?理解音频深度伪造检测的泛化
声音
2024-06-13 v3 人工智能
音频与语音处理
摘要
最近的研究突显了语音深度伪造检测中的一个关键问题:在一组深度伪造上训练的模型在其他组上表现不佳。问题随之而来:这是由于文本到语音(TTS)模型质量的不断提高,即新的深度伪造只是“更难”检测?还是因为使用一个模型生成的深度伪造与使用另一个模型生成的深度伪造根本不同?我们通过将域内和域外测试数据之间的性能差距分解为“难度”和“差异”两个组成部分来回答这个问题。使用ASVspoof数据库进行的实验表明,难度成分实际上可以忽略不计,性能差距主要归因于差异成分。这对现实世界的深度伪造检测具有直接影响,表明仅仅增加模型容量(当前主导的研究趋势)可能无法有效解决泛化挑战。
引用
@article{arxiv.2406.03512,
title = {Harder or Different? Understanding Generalization of Audio Deepfake Detection},
author = {Nicolas M. Müller and Nicholas Evans and Hemlata Tak and Philip Sperl and Konstantin Böttinger},
journal= {arXiv preprint arXiv:2406.03512},
year = {2024}
}