学习高效合规警戒线
人工智能
2026-05-20 v2
摘要
自动化网页智能体正在用于长期任务,但其在实际政策遵从性方面的表现,远未得到对标准安全目标的充分探讨。为填补这一空白,我们提出 PolicyGuardBench,一个包含 6 万条政策-轨迹对的数据集,用于评估通过完整轨迹和新颖的前缀-based 违规检测任务来衡量合规性。使用该数据集,我们训练了 PolicyGuard 模型,该模型在保持高推理效率的同时实现了强大的检测准确性。值得注意的是,模型展现出强大的泛化能力,即使在未见的领域中,仍能保持高性能。这一工作建立了一套全面的框架,用于研究政策合规性,表明在小规模下也可实现准确且可泛化的警戒线。
引用
@article{arxiv.2510.03485,
title = {Learning Efficient Guardrails for Compliance},
author = {Xiaofei Wen and Wenjie Jacky Mo and Yanan Xie and Peng Qi and Muhao Chen},
journal= {arXiv preprint arXiv:2510.03485},
year = {2026}
}
备注
16 pages, 5 figures. Accepted by ICML 2026