语音生成模型的可归因水印技术
声音
2022-03-16 v2 密码学与安全
音频与语音处理
摘要
生成模型如今已能合成与真实内容难以区分的图像、语音与视频。此类能力引发了诸如恶意冒充与知识产权窃取等担忧。本文研究一种模型归因方案,即通过嵌入于内容中的水印,按合成内容的来源模型对其进行分类。基于过去在图像领域模型归因的成功,我们讨论了用于生成用户端语音模型的算法改进,这些改进在经验上实现了高归因准确率,同时保持高生成质量。我们展示了在针对生成语音信号试图去除水印的多种攻击下,可归因性与生成质量之间的权衡,以及学习抵御这些攻击的鲁棒水印的可行性。
引用
@article{arxiv.2202.08900,
title = {Attributable-Watermarking of Speech Generative Models},
author = {Yongbaek Cho and Changhoon Kim and Yezhou Yang and Yi Ren},
journal= {arXiv preprint arXiv:2202.08900},
year = {2022}
}
备注
Accepted to International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2022