中文

不要踩线:面向过滤式生成的边界引导

机器学习 2026-02-16 v2 计算与语言

摘要

生成模型正越来越多地与安全分类器配合使用,以过滤有害或不良输出。一种常见策略是对生成器进行微调以降低被过滤的概率,但这往往并非最优:它常常使模型生成的样本逼近分类器的决策边界,从而同时增加假阳性与假阴性。我们提出边界引导(Boundary Guidance),一种显式引导生成远离分类器间隔的强化学习微调方法。在一组涵盖越狱、模糊与长上下文提示的基准测试中,边界引导在 LLM-as-a-Judge 评估下同时提升了输出的安全性与实用性。跨模型规模与奖励设计的全面消融实验证明了我们方法的鲁棒性。

关键词

引用

@article{arxiv.2510.11834,
  title  = {Don't Walk the Line: Boundary Guidance for Filtered Generation},
  author = {Sarah Ball and Andreas Haupt},
  journal= {arXiv preprint arXiv:2510.11834},
  year   = {2026}
}

备注

14 pages, 3 figures, 10 tables