XAttnMark:基于跨注意力机制学习鲁棒音频水印
声音
2026-05-25 v3 人工智能
密码学与安全
机器学习
音频与语音处理
摘要
生成式音频合成与编辑技术的快速普及,引发了关于版权侵权、数据源头追溯以及通过深度伪音扩散虚假信息的严重担忧。水印技术提供了一种主动解决方案,通过在音频内容中嵌入不可感知但可识别且可追溯的信号来实现此目标。虽然近期类似 WavMark 和 AudioSeal 的神经网络基水印方法在鲁棒性和质量方面取得了改进,但它们难以同时优化稳健检测和准确归因。本文介绍了跨注意力鲁棒音频水印(XATTNMARK),通过在生成器与探测器之间实现部分参数共享、利用跨注意力机制实现高效信息检索,以及引入时序条件模块以改进信息分布。此外,我们提出了面向听觉掩蔽效应的时频(TF)掩码损失,捕捉细粒度的听觉掩蔽效应,提高水印的不可感知性。XATTNMARK 在检测和归因方面实现了最佳性能,展现出对广泛范围的音频变换具有优异鲁棒性,包括不同强度下的挑战性生成式编辑。本工作推动了面向生成式 AI 时代的音频水印技术,以保护知识产权并确保内容真实性。
引用
@article{arxiv.2502.04230,
title = {XAttnMark: Learning Robust Audio Watermarking with Cross-Attention},
author = {Yixin Liu and Lie Lu and Jihui Jin and Lichao Sun and Andrea Fanelli},
journal= {arXiv preprint arXiv:2502.04230},
year = {2026}
}
备注
Accepted at ICML'25