MarkTune:改进开放权重大语言模型水印的质量-可检测性权衡
机器学习
2025-12-04 v1 人工智能
密码学与安全
摘要
水印旨在嵌入隐藏信号于生成文本中,以便在获取密钥后可被可靠检测。开放权重大语言模型对此类水印方案构成严峻挑战,因为主导当代方法的推理时干预一旦模型权重公开便无法强制执行。现有针对开放权重模型的水印技术,如最近提出的 GaussMark,通常依赖对模型权重的微小修改,虽能生成对持有密钥者可检测的信号,但要实现与推理时水印相当的检测功效,往往需要显著影响生成质量的权重扰动。我们引入 MarkTune,一个理论上严谨的策略性微调框架,将 GaussMark 信号作为奖励,同时正则化防止文本质量下降。我们将 MarkTune 作为 GaussMark 的改进版本,证明其在保持生成质量的同时,能持续改善质量-可检测性权衡,通过在表示空间内引导更细致的水印感知权重更新。经验上,我们表明 MarkTune 将 GaussMark 的质量-可检测性前沿推近至推理时水印的水平,对抗改写和微调攻击具有鲁健性,并展现出强大的泛化能力:在一个数据集上微调的模型在未见数据集上仍保留显著的水印检测能力。总体而言,这些结果确立了 MarkTune 作为嵌入稳健、高质量水印于开放权重大语言模型的通用策略。
引用
@article{arxiv.2512.04044,
title = {MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking},
author = {Yizhou Zhao and Zhiwei Steven Wu and Adam Block},
journal= {arXiv preprint arXiv:2512.04044},
year = {2025}
}