BARRED:通过非对称辩论合成训练自定义政策警戒线
计算与语言
2026-04-29 v1 人工智能
机器学习
摘要
部署自定义政策的警戒线仍然具有挑战性,因为通用安全模型无法捕捉任务特定的要求,而且使用提示 LLM 存在边界案例性能不一致和高推理成本的问题。训练自定义分类器可实现准确率和效率,但需要大量标注数据且获取成本高昂。我们提出 BARRED(Boundary Alignment Refinement through REflection and Debate),即通过反思和辩论生成忠实且多样化的合成训练数据的框架,只需任务描述和少量未标记示例。我们的方法将领域空间分解为维度以确保全面覆盖,并采用多智能体辩论来验证标签的正确性,从而构建高保真训练语料库。跨越 diverse custom policies 的实验表明,在我们合成数据上微调的小型语言模型持续优于最先进的专有 LLM(包括推理模型)和专用警戒模型。消融研究确认,维度分解和基于辩论的验证对确保训练数据的多样性和标签忠实性至关重要。BARRED 框架消除了对大量人工标注的依赖,为准确构建自定义警戒线提供了可扩展解决方案。
引用
@article{arxiv.2604.25203,
title = {BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate},
author = {Arnon Mazza and Elad Levi},
journal= {arXiv preprint arXiv:2604.25203},
year = {2026}
}