可解释性与仇恨言论:结构化解释加快社交媒体内容审核员的工作速度
计算与语言
2024-06-07 v1
摘要
内容审核员在保持社交媒体讨论健康方面发挥着关键作用。他们需要判断的高内容量代表了对审核流程的瓶颈,而尚无研究探索如何让模型支持他们更快地做出决策。尽管已有大量关于检测仇恨言论的研究,有时明确表示希望改进内容审核,但使用真实内容审核员的研究却寥寥无几。本文我们考察了解释对真实审核员速度的影响。我们的实验表明,虽然通用解释不影响他们的速度且常被忽略,但结构化解释可将审核员的决策制定时间缩短7.4%。
引用
@article{arxiv.2406.04106,
title = {Explainability and Hate Speech: Structured Explanations Make Social Media Moderators Faster},
author = {Agostina Calabrese and Leonardo Neves and Neil Shah and Maarten W. Bos and Björn Ross and Mirella Lapata and Francesco Barbieri},
journal= {arXiv preprint arXiv:2406.04106},
year = {2024}
}
备注
11 pages, 14 figures, to be published at ACL 2024