OmniCompliance-100K:面向多域、规则导向的真实世界安全合规数据集
计算与语言
2026-04-17 v2
摘要
确保大型语言模型(LLM)的安全与合规性至关重要。然而,现有的LLM安全数据集常依赖非正式的分类体系进行数据生成,且缺乏不可或缺的、以规则为依据的真实案例,以致难以稳健地保护LLM。本文从合规视角出发,构建了全面的安全数据集。我们运用强大的网络搜索智能体,收集了来自多域权威来源的规则导向、真实案例数据集OmniCompliance-100K。该数据集涵盖74项跨多领域的法规与政策,包括安全与隐私法规、来自领先AI公司和社交媒体平台的内容安全与用户数据隐私政策、金融安全要求、医疗器械风险管理标准、教育诚信指南以及基本人权保护。总计,数据集包含12,985条独立规则及106,009条关联真实合规案例。我们分析确认规则与其对应案例之间存在强烈的对齐性。进一步我们开展了大规模基准实验,以评估不同模型规模下先进LLM的安全与合规能力。我们的实验揭示了若干有趣的发现,具有为未来LLM安全研究提供宝贵洞见的潜力。
引用
@article{arxiv.2603.13933,
title = {OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset},
author = {Wenbin Hu and Huihao Jing and Haochen Shi and Changxuan Fan and Haoran Li and Yangqiu Song},
journal= {arXiv preprint arXiv:2603.13933},
year = {2026}
}
备注
Accepted to ACL 2026 Findings