中文

大语言模型的交叉注意力水印技术

计算与语言 2024-04-10 v1 人工智能

摘要

本文提出一种新的语言模型语言水印方法,能在保持输出文本可读性与原意的同时,将信息隐蔽地嵌入其中。该方法在推理阶段利用交叉注意力机制将水印嵌入文本。文中给出了两种使用交叉注意力的方法,以最小化水印对预训练模型性能的影响。通过探索优化水印的不同训练策略,以及分析该方法在实际场景中应用的挑战与影响,厘清了水印鲁棒性与文本质量之间的权衡。对于高熵句子,水印的选择会显著影响生成输出。这种主动式水印方法在未来的模型开发中具有潜在应用价值。

关键词

引用

@article{arxiv.2401.06829,
  title  = {Cross-Attention Watermarking of Large Language Models},
  author = {Folco Bertini Baldassini and Huy H. Nguyen and Ching-Chung Chang and Isao Echizen},
  journal= {arXiv preprint arXiv:2401.06829},
  year   = {2024}
}

备注

5 pages, 3 figures. Accepted to ICASSP 2024