中文

语音深度伪造的多语言来源追踪:首个基准

音频与语音处理 2025-08-07 v1 计算与语言 声音

摘要

生成式 AI 的最新进展使得仅凭几秒钟的音频就能轻松创建听起来自然的深度伪造语音。虽然这些工具支持有用的应用,但它们也引发了严重的担忧,因为可以生成多种语言的令人信服的伪造语音。当前的研究主要集中在检测伪造语音上,但很少关注追踪用于生成它们的源模型。本文引入了首个用于多语言语音深度伪造来源追踪的基准,涵盖单语和跨语言场景。我们比较研究了基于 DSP 和 SSL 的建模;考察了在不同语言上微调的 SSL 表示如何影响跨语言泛化性能;并评估了对未见语言和说话人的泛化能力。我们的发现为训练和推理语言不同时识别语音生成模型的挑战提供了首批全面见解。数据集、协议和代码可在 https://github.com/xuanxixi/Multilingual-Source-Tracing 获取。

关键词

引用

@article{arxiv.2508.04143,
  title  = {Multilingual Source Tracing of Speech Deepfakes: A First Benchmark},
  author = {Xi Xuan and Yang Xiao and Rohan Kumar Das and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2508.04143},
  year   = {2025}
}

备注

Accepted at Interspeech SPSC 2025 - 5th Symposium on Security and Privacy in Speech Communication (Oral)