蒸馏思维,水印答案:面向大型推理模型的原则语义引导水印
人工智能
2026-04-02 v2
摘要
在复杂任务中表现卓越的推理大型语言模型为数字水印带来了独特挑战,因为现有方法通常会破坏逻辑连贯性或产生高昂的计算成本。基于Token的水印技术通过施加伪随机偏置可能会破坏推理流程,而语义感知方法虽能提高质量,却引入了显著的延迟或需要辅助模型。本文提出了ReasonMark,一种专为推理密集型LLM设计的新型水印框架。我们的方法将生成分解为不受干扰的思考阶段和加水印的回答阶段。我们提出了一个关键性分数,用于从推理轨迹中识别语义上关键的Token,并将其蒸馏为原则语义向量(PSV)。随后,PSV引导一种语义自适应机制,根据Token与PSV的对齐程度调制水印强度,在不损害逻辑完整性的前提下确保鲁棒性。大量实验表明,ReasonMark超越了现有最先进方法,将文本困惑度降低了0.35,翻译BLEU分数提高了0.164,数学准确率提高了0.67分。这些进步伴随着0.34%更高的水印检测AUC以及对攻击的更强鲁棒性,且延迟增加可忽略不计。这项工作使得推理LLM在现实应用中的可追溯和可信赖部署成为可能。
引用
@article{arxiv.2601.05144,
title = {Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models},
author = {Shuliang Liu and Xingyu Li and Hongyi Liu and Dong Fang and Yibo Yan and Bingchen Duan and Qi Zheng and Lingfeng Su and Xuming Hu},
journal= {arXiv preprint arXiv:2601.05144},
year = {2026}
}
备注
31 pages, Published in ICLR 2026