中文

PluRule:用于 Moderating Pluralistic Communities on Social Media 的基准

计算与语言 2026-05-19 v1 人工智能 计算机与社会

摘要

社交媒体正向多元化转变——社区自治平台,各群体自行定义其规范。一个社区中的违规行为在另一个社区中可能完全可接受。AI 模型能否帮助调控此类多元化社区?我们将此任务形式化为多选问题,镜像人类主持人在真实世界中的运作方式:给定评论及其周围上下文,识别哪条具体规则(若有)被违反。我们引入 PluRule,一个多模态、多语言基准,用于检测跨 1,989 个 Reddit 社区、2,885 条规则、9 语言中 13,371 条违规。使用此基准,我们表明最先进的视觉语言模型难以胜任:即便是 GPT-5.2 高推理能力也仅略胜于平凡基线。我们还发现更大模型和增加上下文仅提供边际收益,而普遍规则如文明与自我推销等易于检测。我们的结果表明,社交媒体上对多元化社区的调控是语言模型的根本性挑战。我们的代码与基准已公开。

关键词

引用

@article{arxiv.2605.17187,
  title  = {PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media},
  author = {Zoher Kachwala and Bao Tran Truong and Rasika Muralidharan and Haewoon Kwak and Jisun An and Filippo Menczer},
  journal= {arXiv preprint arXiv:2605.17187},
  year   = {2026}
}

备注

Accepted to ACL 2026 Main Conference