中文

HateBuffer:通过仇恨言论内容修改保护内容审核员心理健康

人机交互 2025-08-04 v1

摘要

仇恨言论仍然是网络平台中一项持续存在且未解决的挑战。内容审核员身处一线,负责审查用户生成的内容并保护观众免受仇恨言论侵害,但他们在持续接触攻击性语言的过程中往往得不到心理负担方面的保护。为保障审核员的心理健康,我们设计了HateBuffer,它对仇恨言论的目标进行匿名化,将攻击性表达改写为较温和的形式,并在审核员选择查看时显示原始表达。我们与80名参与者进行的用户研究包括一项设置在虚构新闻平台上的模拟仇恨言论审核任务,随后进行半结构化访谈。尽管参与者在使用HateBuffer时对评论的仇恨严重程度评分较低,但与我们的预期相反,他们并未相比对照组体验到情绪改善或疲劳减轻。然而,在访谈中,参与者将HateBuffer描述为抵御情绪传染和仇恨言论中偏见观点正常化的有效缓冲。值得注意的是,HateBuffer未损害审核准确性,甚至略微提升了召回率。我们探讨了HateBuffer感知收益与其对心理健康实际影响之间存在差异的可能原因,并强调了基于文本的内容修改技术作为营造更健康内容审核环境工具的前景。

关键词

引用

@article{arxiv.2508.00439,
  title  = {HateBuffer: Safeguarding Content Moderators' Mental Well-Being through Hate Speech Content Modification},
  author = {Subin Park and Jeonghyun Kim and Jeanne Choi and Joseph Seering and Uichin Lee and Sung-Ju Lee},
  journal= {arXiv preprint arXiv:2508.00439},
  year   = {2025}
}

备注

Accepted by ACM CSCW 2025; 39 pages (including 6 pages of Appendix)