R-CoT:基于大语言模型中冗余链式思维的推理层水印
密码学与安全
2026-04-29 v1
摘要
大语言模型(LLM)因其推理能力在多个场景中广泛部署。为防止模型被滥用,通常会采用水印技术来确保所有权。然而,大多数现有水印方法依赖于对模型输出分布的浅层修改,使得水印容易受到扰动和移除。为克服这一挑战,本文引入一种称为冗余链式思维(R-CoT)的推理层框架,将水印嵌入推理路径中。基于GRPO的双轨道优化机制使原生路径与水印推理路径能够共存于共享参数空间,从而将水印内化为一种独特的推理策略。因此,水印嵌入模型稳定的推理路径中,避免了由于输出水平扰动导致的水印失效。实验结果表明,与现有方法相比,R-CoT实现了高水印有效性和强鲁棒性。在精细调优和其他后训练操作下,真阳性率(TPR)始终保持在95%以上,仅出现轻微下降。
引用
@article{arxiv.2604.25247,
title = {R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models},
author = {Ziming Zhang and Li Li and Guorui Feng and Hanzhou Wu and Xinpeng Zhang},
journal= {arXiv preprint arXiv:2604.25247},
year = {2026}
}