中文

GMP:面向共现违规与动态规则的内容审查基准

人工智能 2026-03-03 v1

摘要

在线内容审查对于维护健康的数字环境至关重要,AI的依赖持续增长。考虑一个用户评论使用民族刻板印象讽刺政治家。这一例子阐释了现实场景中的两个关键挑战:(1)共现违规(co-occurring violations),即单篇帖子违反多个政策(如偏见和人身攻击);(2)内容审查的动态规则,即违规判断取决于特定平台的准则,这些准则在不同情境下会随时间演变。共现伤害与动态变化规则的交叉凸显了当前AI系统的一个核心局限:尽管大型语言模型(LLM)擅长遵循固定准则,但其判断能力在政策不稳定或情境依赖时会下降。实际情况下,这种缺陷会导致审查不一致:要么错误地限制合法表达,要么允许有害内容在线。这引出一个关键评估问题:现有静态基准的高性能是否真正保证AI判断在涉及共现违规和动态变化规则的真实场景中具备稳健的泛化能力?

关键词

引用

@article{arxiv.2603.01724,
  title  = {GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules},
  author = {Houde Dong and Yifei She and Kai Ye and Liangcai Su and Chenxiong Qian and Jie Hao},
  journal= {arXiv preprint arXiv:2603.01724},
  year   = {2026}
}