中文

ModelCitizens: 在线安全中代表社区声音的做法

计算与语言 2025-07-10 v2 人工智能

摘要

自动检测有毒语言对于创建安全、包容的线上空间至关重要。然而,这是一项高度主观的任务,语言毒性的感知受到社区规范和亲身经历的影响。现有的毒性检测模型通常在训练时将多元化注释者的视角坍缩为单一真实值,抹杀了诸如“回收语言”等重要的特定语境下的毒性概念。为此,我们引入 MODELCITIZENS—a 包含 6800 条社交媒体帖子和 40000 条毒性注释的 数据集,覆盖来自不同身份群体的注释。为了捕捉社交媒体帖子中典型的对话情境对毒性的作用,我们通过 LLM 生成的对话情景来增强 MODELCITIZENS 的帖子。现有的毒性检测工具(如 OpenAI 审核 API、GPT-o4-mini)在 MODELCITIZENS 上表现不佳,情境增强后的帖子性能进一步下降。最后,我们发布了 LLAMACITIZEN-8B 和 GEMMACITIZEN-12B 两个基于 LLaMA 和 Gemma 架构的模型,这两个模型在分布式评估中比 GPT-o4-mini 高出 5.5%。我们的发现凸显了社区信息化注释和建模对于包容性内容审核的重要性。数据、模型和代码均可在 https://github.com/asuvarna31/modelcitizens 获取。

关键词

引用

@article{arxiv.2507.05455,
  title  = {ModelCitizens: Representing Community Voices in Online Safety},
  author = {Ashima Suvarna and Christina Chance and Karolina Naranjo and Hamid Palangi and Sophie Hao and Thomas Hartvigsen and Saadia Gabriel},
  journal= {arXiv preprint arXiv:2507.05455},
  year   = {2025}
}