中文

LLM 输出可检测性与任务性能可联合优化

计算与语言 2026-05-05 v1

摘要

检测机器生成文本对于在部署大语言模型(LLMs)时实现透明度和问责制至关重要。在检测方法中,watermarking 是一种以设计上可靠的方法——它通过偏置其 token 分布来将可检测信号嵌入LLM输出。然而,已有报告称水印化的LLM在下游任务上表现较差。我们提出PUPPET,一个框架,通过强化学习微调LLM以生成更可检测且在下游任务上表现更好的文本。我们使用两个奖励函数:一个输出机器类别概率的检测器,以及衡量任务特定指标的评估器。实验表明,使用PUPPET训练的LLM在可检测性上与watermarking 方法相当,而在下游任务上则超越了它们。分析表明,这种优化可以在仅使用几千样本的情况下高效完成,仅需 1--2 个 GPU 小时。此外,这些提升在不同领域的任务、不同的LLM家族以及模型规模中均保持一致,并且对 paraphrase 攻击具有鲁棒性。

关键词

引用

@article{arxiv.2605.01350,
  title  = {LLM Output Detectability and Task Performance Can be Jointly Optimized},
  author = {Koshiro Saito and Ryuto Koike and Masahiro Kaneko and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2605.01350},
  year   = {2026}
}

备注

Preprint. Under review