跨人口统计学标签的有毒评论映射:来自德国公共广播的 dataset
计算与语言
2025-09-01 v1 计算机与社会
摘要
现有有毒言论数据集缺乏人口统计学背景,限制了我们理解不同年龄群体在线交流方式的能力。本研究与德国公共服务内容网络 funk 合作,引入首个大规模德语数据集,标注了有毒性并包含平台提供的年龄估计。数据集包括 3,024 项人工标注和 30,024 项大语言模型标注的匿名评论,来源于 Instagram、TikTok 和 YouTube。为确保相关性,评论经使用预定义的有毒关键词整合后,仅 16.7% 被标记为有问题。标注流程结合人工专家知识与最新语言模型,识别出包括侮辱、虚假信息以及对广播费批评等关键类别。数据集揭示了基于年龄的有毒言论模式差异,年轻用户倾向于使用表达性语言,而年长用户更常进行虚假信息宣传和贬低。该资源为研究跨人口统计学语言变异提供新机会,支持开发更具公平性和年龄感知的内容 moderation 系统。
引用
@article{arxiv.2508.21084,
title = {Mapping Toxic Comments Across Demographics: A Dataset from German Public Broadcasting},
author = {Jan Fillies and Michael Peter Hoffmann and Rebecca Reichel and Roman Salzwedel and Sven Bodemer and Adrian Paschke},
journal= {arXiv preprint arXiv:2508.21084},
year = {2025}
}
备注
The paper has been accepted to the EMNLP 2025 main track