解决基于大语言模型的隐写术与水印中的分词不一致性
计算与语言
2025-08-29 v1
摘要
大语言模型显著提升了文本生成的能力和效率。一方面,它们提高了基于文本的隐写术的质量;另一方面,它们也凸显了水印技术作为防范恶意滥用保障手段的重要性。在本研究中,我们关注隐写术和水印中 Alice 与 Bob 之间的分词不一致性,其中 TI 会削弱鲁棒性。我们的调查表明,导致 TI 的问题 token 表现出两个关键特征:低频性和临时性。基于这些发现,我们提出了两种针对 TI 消除的定制解决方案:用于隐写术的逐步验证方法和用于水印的事后回滚方法。实验表明:(1) 与隐写术中的传统消歧方法相比,直接处理 TI 在流畅性、不可感知性和抗隐写分析能力方面带来了提升;(2) 对于水印,处理 TI 增强了可检测性和抵御攻击的鲁棒性。
引用
@article{arxiv.2508.20718,
title = {Addressing Tokenization Inconsistency in Steganography and Watermarking Based on Large Language Models},
author = {Ruiyi Yan and Yugo Murawaki},
journal= {arXiv preprint arXiv:2508.20718},
year = {2025}
}