你可以在二手视镜上进行微调吗?将文本水印嵌入大语言模型的权重中
机器学习
2025-04-10 v1 人工智能
摘要
AI 生成内容与人类文本的不可区分性在透明度和问责方面提出了挑战。虽然已有多种方法可为位于 API 后端的模型嵌入水印策略,但将水印策略直接嵌入模型权重并在模型输出中反映出来的做法具有挑战性。本研究提出一种策略,通过对模型进行一对低秩适配器的微调,其中一个适配器作为文本生成模型,另一个适配器作为检测器,以便在第一个模型生成的文本中嵌入细微的水印,并同时优化第二个适配器的检测可见性。如此一来,水印策略即可通过端到端方式完全学习。此过程具有优化挑战,因为在水印鲁棒性、自然性和任务性能之间需要权衡。我们讨论了如何优化这一 min-max 目标的策略,并呈现结果,显示此修改对指令微调的影响。
引用
@article{arxiv.2504.06446,
title = {Can you Finetune your Binoculars? Embedding Text Watermarks into the Weights of Large Language Models},
author = {Fay Elhassan and Niccolò Ajroldi and Antonio Orvieto and Jonas Geiping},
journal= {arXiv preprint arXiv:2504.06446},
year = {2025}
}