面向演唱声音深度伪造的多模态基础模型源归因
音频与语音处理
2025-06-05 v1 多媒体
声音
摘要
本文引入演唱声音深度伪造源归因(SVDSA)任务。我们假设,多模态基础模型(MMFMs)如 ImageBind、LanguageBind 对 SVDSA 最为有效,因为它们更擅长捕捉每种演唱声音深度伪造来源所特有的细微来源特征——例如独特的音色、音高操作或合成痕迹。我们通过 MMFMs、语音基础模型和音乐基础模型的实验验证了这一假设,证实 MMFMs 在 SVDSA 中最为有效。此外,受相关研究启发,我们还探索了基础模型(FMs)的融合以提高 SVDSA 效果。为此,我们提出了一种新框架 COFFE,该框架将 Chernoff 距离作为新的损失函数以实现 FMs 的有效融合。通过 COFFE 与 MMFMs 的协同作用,我们在与所有单个 FMs 和基线融合方法的比较中实现了最高性能。
引用
@article{arxiv.2506.03364,
title = {Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models},
author = {Orchid Chetia Phukan and Girish and Mohd Mujtaba Akhtar and Swarup Ranjan Behera and Priyabrata Mallick and Pailla Balakrishna Reddy and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2506.03364},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025