基于策略推理痕迹的语言模型比例政策合规性评估
计算与语言
2025-09-30 v1 机器学习
摘要
政策合规性评估是评估输入案例是否严格遵守一组人类定义规则的基本任务,这些规则通常称为政策。在实际操作中,人类专家会遵循系统性、逐步的过程来识别与特定规定违反的情形。然而,获取此类金标准、专家水平推理过程的文档成本很高。本文引入策略推理痕迹(PRT),这是一类专门生成的推理链,作为推理桥梁,用于提高大语言模型(LLM)的政策合规性评估能力。我们的实证评估表明,对于推理阶段和训练阶段的场景,使用 PRT 可显著提升开源模型和商业模型的性能,为 HIPAA 和 GDPR 政策设定了新的状态-of-the-art。除了准确性提升,我们还强调,PRT 还能提高 LLM 准确引用政策条款的能力,以及通过高度利用原始思维链影响合规决策。
引用
@article{arxiv.2509.23291,
title = {Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces},
author = {Joseph Marvin Imperial and Harish Tayyar Madabushi},
journal= {arXiv preprint arXiv:2509.23291},
year = {2025}
}