中文

逃离协议陷阱:评估规则驱动AI的可辩性信号

人工智能 2026-04-24 v1 计算机与社会

摘要

内容审核系统通常通过衡量与人类标签的一致性来进行评估。在规则驱动的环境中,这一假设不成立:多个决策可能与统治政策保持逻辑一致,而一致性指标会惩罚有效决策,同时将模糊性误认为错误——我们称之为协议陷阱。我们将评估形式化为政策 grounding 正确性,引入可辩性指数 (DI) 和模糊度指数 (AI)。为估计推理稳定性而无需额外审计 passes,我们引入概率可辩性信号 (PDS),源于审计模型 token logprobs。我们利用LLM推理轨迹作为治理信号,而非分类输出,通过部署审计模型而非决定内容是否违反政策,从而验证所提出的决策是否可从统治规则层级中逻辑推导出来。我们在193,000+个Reddit审核决策上进行了验证,跨越多个社区和评估cohorts,发现一致性基于和政策 grounding 指标之间存在33-46.6个百分点差距,其中79.8-80.6%的模型假阴性对应于政策 grounding 决策而非真实错误。我们进一步表明,测量的模糊性由规则具体性驱动:对37,286个相同决策在三个同一社区规则层级下进行审核,AI降低10.8 pp,而DI保持稳定。重复抽样分析将PDS方差归因于治理模糊性而非解码噪声。基于这些信号构建的治理门控实现了78.6%的自动化覆盖率,实现64.9%的风险降低。综上,这些结果表明,在规则驱动的环境中,评估应从与历史标签的一致性,转向基于明确规则的推理 grounding 正确性。

关键词

引用

@article{arxiv.2604.20972,
  title  = {Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI},
  author = {Michael O'Herlihy and Rosa Català},
  journal= {arXiv preprint arXiv:2604.20972},
  year   = {2026}
}

备注

22 pages, 10 figures, preprint. Research on Defensibility Index (DI), Ambiguity Index (AI), and Probabilistic Defensibility Signal (PDS) for policy-grounded evaluation of rule-governed AI in content moderation (Reddit production data)