中文

开放域安全政策构建

计算与语言 2026-04-03 v1

摘要

审核层在越来越多的基于用户生成内容或模型生成内容的产品中成为核心组件。然而,起草和维护特定领域的安全政策仍然昂贵。我们提出Deep Policy Research (DPR),一个最小化的代理系统,仅基于人类编写的种子领域信息即可草拟完整的内容审核政策。DPR 使用单个 web 搜索工具和轻量级脚手架,迭代提出搜索查询,将多样化的 web 资源提炼为政策规则,并将规则组织成索引文档。我们在 (1) OpenAI 不期望内容基准的五个领域中使用两个紧凑阅读 LLM 对 DPR 进行评估,以及 (2) 我们内部的多模态广告审核基准进行评估。DPR 在定义性和情境学习基线中 consistently 优于后者,在我们的端到端设置中,在几个领域中与专家编写的政策章节相当。此外,在相同的种子规格和评估协议下,DPR 超过了通用深层研究系统,表明特定任务、结构化的研究循环对于政策草拟可能比通用 web 研究更有效。我们在 https://github.com/xiaowu0162/deep-policy-research 上发布了我们的实验代码。

关键词

引用

@article{arxiv.2604.01354,
  title  = {Open-Domain Safety Policy Construction},
  author = {Di Wu and Siyue Liu and Zixiang Ji and Ya-Liang Chang and Zhe-Yu Liu and Andrew Pleffer and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2604.01354},
  year   = {2026}
}

备注

EACL 2026 (Findings)