中文

跨人口统计学标签的有毒评论映射:来自德国公共广播的 dataset

计算与语言 2025-09-01 v1 计算机与社会

摘要

现有有毒言论数据集缺乏人口统计学背景,限制了我们理解不同年龄群体在线交流方式的能力。本研究与德国公共服务内容网络 funk 合作,引入首个大规模德语数据集,标注了有毒性并包含平台提供的年龄估计。数据集包括 3,024 项人工标注和 30,024 项大语言模型标注的匿名评论,来源于 Instagram、TikTok 和 YouTube。为确保相关性,评论经使用预定义的有毒关键词整合后,仅 16.7% 被标记为有问题。标注流程结合人工专家知识与最新语言模型,识别出包括侮辱、虚假信息以及对广播费批评等关键类别。数据集揭示了基于年龄的有毒言论模式差异,年轻用户倾向于使用表达性语言,而年长用户更常进行虚假信息宣传和贬低。该资源为研究跨人口统计学语言变异提供新机会,支持开发更具公平性和年龄感知的内容 moderation 系统。

关键词

引用

@article{arxiv.2508.21084,
  title  = {Mapping Toxic Comments Across Demographics: A Dataset from German Public Broadcasting},
  author = {Jan Fillies and Michael Peter Hoffmann and Rebecca Reichel and Roman Salzwedel and Sven Bodemer and Adrian Paschke},
  journal= {arXiv preprint arXiv:2508.21084},
  year   = {2025}
}

备注

The paper has been accepted to the EMNLP 2025 main track