毒性检测并非全部所需:衡量对志愿内容审核员支持的差距
计算与语言
2024-11-14 v4 人工智能
摘要
自动化内容审核方法的广泛努力集中于开发模型以识别有毒、攻击性和仇恨内容,旨在减轻审核员的负担。然而,这些任务上的改进是否真正解决了审核员完成工作时的需求仍不确定。在本文中,我们揭示了过去旨在为内容审核的某些方面提供自动化的研究工作与志愿内容审核员在识别各类审核规则违规方面的需求之间的差距。为此,我们对 Hugging Face 上的模型进行了综述,以揭示覆盖来自三个示例论坛的各种审核规则和指南的模型可用性。我们进一步对最先进的 LLM 进行测试,评估这些模型在标记某一特定论坛平台规则违规方面的表现。最后,我们对志愿审核员进行了用户调查研究,以了解他们对有用审核模型的看法。总体而言,我们观察到显著的差距,因为缺失的已开发模型以及 LLM 在相当大一部分规则上表现出中等至较低的性能。审核员的报告为未来开发审核辅助模型的工作提供了指导。
引用
@article{arxiv.2311.07879,
title = {Toxicity Detection is NOT all you Need: Measuring the Gaps to Supporting Volunteer Content Moderators},
author = {Yang Trista Cao and Lovely-Frances Domingo and Sarah Ann Gilbert and Michelle Mazurek and Katie Shilton and Hal Daumé},
journal= {arXiv preprint arXiv:2311.07879},
year = {2024}
}