水印会损害语言模型的对齐效果:分析与缓解措施
计算与语言
2026-02-25 v4 密码学与安全
机器学习
摘要
水印已成为跟踪语言模型输出的实用工具,但它会在推理时修改标记概率,这些概率是通过对齐训练精心调谐的。这导致了一个紧张关系:水印引起的偏移如何与旨在使模型安全有用化的程序相互作用?在几个当代模型和两个代表性水印方案上进行实验,揭示水印会引起非平凡且具有模式性却具有模型特定性质的对齐偏移。我们观察到两种失效模式:警戒削弱,即模型变得更有帮助但不够安全;警戒放大,即拒绝变得过于保守。即使控制了困惑度退化,这些效应仍然存在,指向的是特定于对齐的扭曲,而不仅仅是质量损失。我们通过 Alignment Resampling(AR)来解决该问题,这是一种采样多个水印输出并根据外部奖励模型选择最符合对齐要求的响应的程序。利用关于高斯随机变量期望最大值的结果,我们推导出对齐收益随样本量增长亚对数式的理论下界。实际情况下,仅采样两到四个候选即可在不损害水印检测的情况下,基本恢复未使用水印的对齐性能,包括真实性、安全性和有用性。这是首个关于水印—对齐相互作用的实证研究;它表明,一个简单的推理时解决方案即可恢复对齐。
引用
@article{arxiv.2506.04462,
title = {Watermarking Degrades Alignment in Language Models: Analysis and Mitigation},
author = {Apurv Verma and NhatHai Phan and Shubhendu Trivedi},
journal= {arXiv preprint arXiv:2506.04462},
year = {2026}
}
备注
Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)