Indic-CodecFake 与 SATYAM:迈向检测印度语系中神经音频编解码器合成的语音深度伪造
音频与语音处理
2026-04-23 v1
摘要
由神经音频编解码器驱动的音频大语言模型的快速发展催生了高度逼真的语音深度伪造,通常被称为 CodecFakes (CFs)。因此,CF 检测引起了研究界越来越多的关注。然而,现有研究主要关注英语或中文,使得印度语系的脆弱性在很大程度上未被探索。为了填补这一空白,我们引入了 Indic-CodecFake (ICF) 数据集,这是第一个包含跨多种印度语系、多样化说话人特征和多种 NAC 类型的真实与 NAC 合成语音的大规模基准。我们使用 IndicSUPERB 作为生成 ICF 数据集的真实语音语料库。我们的实验表明,在以英语为中心的数据集上训练的最先进(SOTA)CF 检测器无法泛化到 ICF,凸显了印度语系语音中语音多样性和韵律变异性带来的挑战。此外,我们在 ICF 数据集上对 SOTA ALM 在零样本设置下进行了系统评估。我们评估这些 ALM 是因为它们已在不同的语音任务中展现出有效性。然而,我们的发现表明,当前的 ALM 表现持续不佳。为了解决这个问题,我们提出了 SATYAM,一种专为印度语系 CF 检测定制的双曲 ALM。SATYAM 使用双曲空间中的 Bhattacharya 距离融合来自 Whisper 的语义表示和来自 TRILLsson 的韵律表示,随后在融合的语音表示与输入条件提示之间执行相同的对齐过程。这种双阶段融合框架使 SATYAM 能够有效地建模语音内部(语义-韵律)以及跨模态(语音-文本)的层次关系。广泛的评估表明,SATYAM 在 ICF 基准上始终优于具有竞争力的端到端和基于 ALM 的基线。
引用
@article{arxiv.2604.19949,
title = {Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages},
author = {Girish and Mohd Mujtaba Akhtar and Orchid Chetia Phukan and Arun Balaji Buduru},
journal= {arXiv preprint arXiv:2604.19949},
year = {2026}
}
备注
Accepted to ACL 2026