SafeSpeech:用于分析对话中性别歧视与辱骂语言的综合交互式工具
计算与语言
2025-03-11 v1
摘要
检测包括性别歧视、骚扰和辱骂行为在内的有毒语言仍然是一项关键挑战,尤其是在其微妙且依赖上下文的形式中。现有方法主要侧重于孤立的消息级分类,忽略了在对话上下文中出现的毒性。为了促进并推动这一方向的未来研究,我们引入了 SafeSpeech,这是一个用于有毒内容检测与分析的综合平台,它桥接了消息级和对话级的洞察。该平台集成了微调的分类器和大型语言模型(LLM),以实现多粒度检测、毒性感知的对话摘要以及角色画像。SafeSpeech 还结合了可解释性机制,如困惑度增益分析,以突出驱动预测的语言要素。在包括 EDOS、OffensEval 和 HatEval 在内的基准数据集上的评估表明,该平台在多个任务(包括细粒度性别歧视检测)中重现了现有最优的性能。
引用
@article{arxiv.2503.06534,
title = {SafeSpeech: A Comprehensive and Interactive Tool for Analysing Sexist and Abusive Language in Conversations},
author = {Xingwei Tan and Chen Lyu and Hafiz Muhammad Umer and Sahrish Khan and Mahathi Parvatham and Lois Arthurs and Simon Cullen and Shelley Wilson and Arshad Jhumka and Gabriele Pergola},
journal= {arXiv preprint arXiv:2503.06534},
year = {2025}
}
备注
NAACL 2025 system demonstration camera-ready