中文

设计行为代码(DBCs):面向大语言模型的分层治理基准

人工智能 2026-03-06 v1

摘要

我们提出了Dynamic Behavioral Constraint(DBC)基准,这是第一个用于评估结构化150控制行为治理层MDBC(Madan DBC)在大语言模型(LLM)推理时应用效果的实证框架。与训练时对齐方法(RLHF、DPO)或事后内容 moderation API 不同,DBCs 是一种模型无关、可映射至司法管辖区且可审计的系统提示级治理层。我们在30个领域风险分类学中(分为六个聚类:幻觉与校准、偏见与公平性、恶意用途、隐私与数据保护、鲁棒性与可靠性以及误对齐行为)使用具有代理性红队协议,对抗策略包括直接、角色扮演、零样本、假设和权威冒充,跨3个模型族进行评估。我们的三臂受控设计(Base、Base加Moderation、Base加DBC)实现了风险降低的因果归因。关键发现:DBC层将聚合风险暴露率(RER)从Base的7.19%降至Base加DBC的4.55%,实现了36.8%的相对风险降低;与标准安全 moderation 提示相比仅为0.6%。MDBC遵循得分从Base的8.6提升至Base加DBC的8.7。欧盟AI法规合规性(自动评分)在DBC层下达到8.5。三位评判员评估小组得到Fleiss Kappa大于0.70(实质一致性),验证了我们的自动化管道。聚类消除实验确定完整性保护聚类(MDBC 081 099)提供的最高每个领域风险降低,而灰盒对抗攻击实现DBC绕过率4.83%。我们发布基准代码、提示词数据库及所有评估制品,以便可重复性和随模型演化进行纵向跟踪。

关键词

引用

@article{arxiv.2603.04837,
  title  = {Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models},
  author = {G. Madan Mohan and Veena Kiran Nambiar and Kiranmayee Janardhan},
  journal= {arXiv preprint arXiv:2603.04837},
  year   = {2026}
}

备注

14 pages, 3 figures