WATCHED:一个通过扩展数据来打击仇恨言论的网络AI代理工具
计算与语言
2025-09-03 v1
摘要
网络危害是数字空间中日益严重的问题,危及用户安全并降低对社交媒体平台的信任。其中最持久的一种危害形式是仇恨言论。为了解决这个问题,我们需要能够结合自动化系统的速度和规模与人类审核员的判断力和洞察力的工具。这些工具不仅应能发现有害内容,还应能清晰地解释其决策,从而帮助建立信任和理解。在本文中,我们提出了WATCHED,一个旨在支持内容审核员处理仇恨言论的聊天机器人。该聊天机器人被构建为一个人工智能代理系统,它使用大型语言模型以及多个专用工具。它将新帖子与仇恨言论和中性内容的真实示例进行比较,使用基于BERT的分类器来帮助标记有害信息,利用Urban Dictionary等来源查询俚语和非正式语言,生成思维链推理,并检查平台指南以解释和支持其决策。这种组合使得该聊天机器人不仅能检测仇恨言论,还能基于先例和政策解释为何内容被视为有害。实验结果表明,我们提出的方法超越了现有的最先进方法,宏F1分数达到0.91。该工具专为审核员、安全团队和研究人员设计,通过支持人工智能与人类监督之间的协作,帮助减少网络危害。
引用
@article{arxiv.2509.01379,
title = {WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data},
author = {Paloma Piot and Diego Sánchez and Javier Parapar},
journal= {arXiv preprint arXiv:2509.01379},
year = {2025}
}