中文

XLSR-Kanformer:用于合成语音检测的 KAN 集成模型

声音 2025-10-09 v1 计算与语言 音频与语音处理

摘要

语音合成技术的最新进展导致了日益复杂的欺骗攻击,给自动说话人验证系统带来了重大挑战。虽然基于自监督学习(SSL)模型的系统,特别是 XLSR-Conformer 架构,在合成语音检测中已展现出显著性能,但仍存在架构改进的空间。本文提出了一种新方法,将 XLSR-Conformer 模型中的传统多层感知器(MLP)替换为 Kolmogorov-Arnold 网络(KAN),这是一种基于 Kolmogorov-Arnold 表示定理的强大通用逼近器。我们在 ASVspoof2021 上的实验结果表明,将 KAN 集成到 XLSR-Conformer 模型中可以在等错误率(EER)上相对提升 60.55%(LA 和 DF 集合),并在 21LA 集合上进一步达到 0.70% 的 EER。此外,所提出的替换对各种 SSL 架构也具有鲁棒性。这些发现表明,将 KAN 纳入基于 SSL 的模型是合成语音检测领域发展的一个有前景的方向。

关键词

引用

@article{arxiv.2510.06706,
  title  = {XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection},
  author = {Phuong Tuan Dat and Tran Huy Dat},
  journal= {arXiv preprint arXiv:2510.06706},
  year   = {2025}
}

备注

Accepted to 2025 IEEE International Conference on Advanced Video and Signal-Based Surveillance