中文

可解释性与仇恨言论:结构化解释加快社交媒体内容审核员的工作速度

计算与语言 2024-06-07 v1

摘要

内容审核员在保持社交媒体讨论健康方面发挥着关键作用。他们需要判断的高内容量代表了对审核流程的瓶颈,而尚无研究探索如何让模型支持他们更快地做出决策。尽管已有大量关于检测仇恨言论的研究,有时明确表示希望改进内容审核,但使用真实内容审核员的研究却寥寥无几。本文我们考察了解释对真实审核员速度的影响。我们的实验表明,虽然通用解释不影响他们的速度且常被忽略,但结构化解释可将审核员的决策制定时间缩短7.4%。

关键词

引用

@article{arxiv.2406.04106,
  title  = {Explainability and Hate Speech: Structured Explanations Make Social Media Moderators Faster},
  author = {Agostina Calabrese and Leonardo Neves and Neil Shah and Maarten W. Bos and Björn Ross and Mirella Lapata and Francesco Barbieri},
  journal= {arXiv preprint arXiv:2406.04106},
  year   = {2024}
}

备注

11 pages, 14 figures, to be published at ACL 2024