面向AI检测的条件文本生成水印:揭示挑战与一种语义感知水印补救方法
计算与语言
2024-02-14 v2 密码学与安全
摘要
为缓解与语言模型相关的潜在风险,近期的AI检测研究提出通过随机词汇限制将水印嵌入机器生成文本,并利用该信息进行检测。尽管这些水印仅引起困惑度的轻微恶化,我们的实证研究表明其对条件文本生成的性能造成了显著损害。为解决此问题,我们引入了一种简单而有效的语义感知水印算法,该算法考虑了条件文本生成的特征及输入上下文。实验结果表明,我们提出的方法在包括BART和Flan-T5在内的多种文本生成模型中,于摘要生成和数据到文本生成等任务上取得了实质性改进,同时保持了检测能力。
引用
@article{arxiv.2307.13808,
title = {Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy},
author = {Yu Fu and Deyi Xiong and Yue Dong},
journal= {arXiv preprint arXiv:2307.13808},
year = {2024}
}
备注
8 pages, 6 figures (accepted to AAAI 2024)