中文

Backprompting:利用合成生产数据构建健康建议警戒线

计算与语言 2025-08-27 v1 人工智能

摘要

大型语言模型(LLM)在企业环境中的广泛应用也带来了显著的风险。警戒线技术旨在通过各种检测器来过滤LLM的输入/输出文本,以缓解这些风险。但是,开发和维护稳健的检测器面临诸多挑战,其中之一就是在部署前获取生产质量的标注数据。本文我们提出backprompting,即一种简单而直观的解决方案,用于生成健康建议警戒线开发的生产式标注数据。进一步地,我们将我们的backprompting方法与稀疏的人类在环聚类技术相结合来标记生成的数据。我们的目标是构建一个大致代表原始数据集但类似于真实LLM输出的平行语料库。我们 then 将我们的合成示例注入现有数据集,以生产稳健的训练数据用于我们的检测器。我们在最困难和最细致的警戒线之一——即LLM输出中健康建议的识别——上进行测试,并证明我们的方法优于其他解决方案。我们的检测器能够在参数仅为其他方法400倍时,以最高可达3.73%的优势超越GPT-4o。

关键词

引用

@article{arxiv.2508.18384,
  title  = {Backprompting: Leveraging Synthetic Production Data for Health Advice Guardrails},
  author = {Kellen Tan Cheng and Anna Lisa Gentile and Chad DeLuca and Guang-Jie Ren},
  journal= {arXiv preprint arXiv:2508.18384},
  year   = {2025}
}