VoiceMark:利用说话人特定隐变量的零样本抗语音克隆水印方法
声音
2025-06-02 v2 人工智能
密码学与安全
音频与语音处理
摘要
抗语音克隆(VC)水印是一种用于追踪和防止未经授权克隆的新兴技术。现有方法通过在水印音频上训练 VC 模型,能够有效追踪传统 VC 模型,但在零样本 VC 场景中会失效,因为在此类场景下,模型无需训练即可根据音频提示合成音频。为了解决这一问题,我们提出了 VoiceMark,这是第一种零样本抗 VC 水印方法,它利用说话人特定的隐变量作为水印载体,使水印能够通过零样本 VC 过程转移到合成音频中。此外,我们引入了 VC 模拟数据增强和基于 VAD 的损失函数,以增强对失真的鲁棒性。在多个零样本 VC 模型上的实验表明,VoiceMark 在零样本 VC 合成后的水印检测中达到了 95% 以上的准确率,显著优于仅达到约 50% 的现有方法。代码和演示请见:https://huggingface.co/spaces/haiyunli/VoiceMark
引用
@article{arxiv.2505.21568,
title = {VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents},
author = {Haiyun Li and Zhiyong Wu and Xiaofeng Xie and Jingran Xie and Yaoxun Xu and Hanyang Peng},
journal= {arXiv preprint arXiv:2505.21568},
year = {2025}
}
备注
Accepted by Interspeech 2025