利用 Kolmogorov-Arnold 网络和自监督学习模型提升合成语音检测性能
声音
2025-06-18 v1 计算与语言
音频与语音处理
摘要
语音合成技术的最新进展导致了日益先进的欺骗攻击,对自动说话人验证系统构成了重大挑战。虽然基于自监督学习模型,特别是 XLSR-Conformer 模型的系统,在合成语音检测中已展现出卓越的性能,但架构方面仍有改进空间。在本文中,我们提出了一种新颖的方法,用 Kolmogorov-Arnold 网络替换 XLSR-Conformer 模型中的传统多层感知机,这是一种基于 Kolmogorov-Arnold 表示定理的新型架构。我们在 ASVspoof2021 上的结果表明,将 KAN 集成到基于 SSL 的模型中,可以在 LA 和 DF 数据集上将性能相对提升 60.55%,进而在 21LA 数据集上实现了 0.70% 的等错误率。这些发现表明,将 KAN 纳入基于 SSL 的模型是推进合成语音检测的一个有前景的方向。
引用
@article{arxiv.2506.14153,
title = {Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models},
author = {Tuan Dat Phuong and Long-Vu Hoang and Huy Dat Tran},
journal= {arXiv preprint arXiv:2506.14153},
year = {2025}
}
备注
Accepted to Interspeech 2025