中文

通过后缀优化实现大型语言模型的自适应内容限制

计算与语言 2025-08-05 v1 人工智能

摘要

大型语言模型 (LLM) 已在 diverse applications 中展现出显著的成功。然而,由于其庞大的输出空间,执行内容限制仍是一个重大挑战。这一内容限制的一个方面是通过模型对齐方法(如监督微调, SFT)防止 LLM 生成有害内容。然而,内容限制的需求可能在不同用户组之间差异很大,随时间变化,也不总是与一般的有害性定义一致。由于计算、数据和存储需求的高额,针对这些具体用例应用 SFT 是不切实际的。为此,我们提出了一个名为自适应内容限制 (AdaCoRe) 的新任务,聚焦于无需模型微调的轻量级策略,以防止部署中的 LLM 生成特定用例的受限术语。我们提出了 AdaCoRe 的第一种方法,称为后缀优化 (SOP),通过在任何提示后附加一个短暂的优化后缀来实现 a) 防止目标 LLM 生成一组受限术语,同时 b) 保持输出质量。为评估 AdaCoRe 方法,包括我们的 SOP,我们创建一个新的内容限制基准 (CoReBench),其中包含 400 个提示,涵盖 80 个受限术语,以及 8 个精心挑选的类别。我们在 CoReBench 上演示了 SOP 的有效性,该方法在 Gemma2-2B、Mistral-7B、Vicuna-7B、Llama3-8B 和 Llama3.1-8B 的平均限制率上分别优于系统级基线如系统后缀 15%、17%、10%、9% 和 6%。我们还在 POE 上演示了 SOP 的有效性,该平台托管 various commercial LLM,凸显了其在实际场景中的实用性。

关键词

引用

@article{arxiv.2508.01198,
  title  = {Adaptive Content Restriction for Large Language Models via Suffix Optimization},
  author = {Yige Li and Peihai Jiang and Jun Sun and Peng Shu and Tianming Liu and Zhen Xiang},
  journal= {arXiv preprint arXiv:2508.01198},
  year   = {2025}
}

备注

19 pages