COMPASS:评估大语言模型组织特定政策对齐的框架
人工智能
2026-01-06 v1 计算机与社会
摘要
随着大型语言模型在从医疗到金融等高风险企业应用中的部署,确保遵守组织特定政策已变得至关重要。然而,现有的安全评估仅关注普遍性伤害。我们提出了COMPASS(Company/Organization Policy Alignment Assessment),即首个系统化框架,用于评估大语言模型是否遵守组织的允许名单和禁止名单政策。我们将COMPASS应用于八个多样化的行业场景,生成并验证了5,920个查询,这些查询通过 strategically设计的边缘案例测试常规合规性和对抗鲁棒性。评估了七个最先进的模型,我们发现存在一种根本性不对称:模型可靠地处理合法请求(准确率>95%),但在执行禁止令方面出现灾难性失败,仅拒绝13-40%的对抗性禁止名单违规。这些结果表明当前的大语言模型缺乏适用于政策关键部署所需的鲁棒性,确立了COMPASS作为组织人工智能安全评估的必不可少的框架。
引用
@article{arxiv.2601.01836,
title = {COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs},
author = {Dasol Choi and DongGeon Lee and Brigitta Jesica Kartono and Helena Berndt and Taeyoun Kwon and Joonwon Jang and Haon Park and Hwanjo Yu and Minsuk Kahng},
journal= {arXiv preprint arXiv:2601.01836},
year = {2026}
}