中文

隐藏于词标记之间:用于合成音频的简单稳健、无梯度水印

机器学习 2026-05-26 v1 声音

摘要

随着政策与生成式 AI 能力的同步进展,水印成为内容来源识别的核心问题。针对自回归模型的推理时水印不适用于连续模态,由于离散化不一致性。现有方法通过微调模态标记器来克服这一点,消除了水印的训练-free 优势。在本工作中,我们受离散化词汇冗余的启发,提出了一种优雅解决方案,用于合成音频的强大且稳健的水印。我们对标记错误对水印检测的影响进行了理论分析,并通过通过社区检测获得的简化词汇表来有效缓解这些错误。深入实验表明,我们的无梯度方法可将检测可达性提升多个数量级,同时实现对音频修改的内置鲁棒性。广泛而言,我们发现了多媒体中基于词标记的水印的新型 SOTA,这简单地源于离散表示学习的本质。

关键词

引用

@article{arxiv.2605.25967,
  title  = {Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio},
  author = {Georgios Milis and Yubin Qin and Yihan Wu and Heng Huang},
  journal= {arXiv preprint arXiv:2605.25967},
  year   = {2026}
}

备注

Accepted to ICML 2026