中文

直播聊天中规范违背的分析

计算与语言 2023-10-10 v2

摘要

诸如仇恨言论等有毒语言会阻碍用户参与在线社区并享受流行平台。以往检测有毒语言与规范违背的方法主要关注来自在线论坛与社交媒体(如Reddit和Twitter)的对话。这些方法应用于直播平台(如Twitch和YouTube Live)上的对话时效果较差,因为每条评论仅可见有限时间,且缺乏确立其与其他评论关系的线程结构。在本工作中,我们分享了首个致力于检测直播平台上对话中规范违背的NLP研究。我们定义了直播聊天中的规范违背类别,并标注了来自Twitch的4,583条被审核评论。我们阐明了直播数据区别于其他论坛的若干方面,并证明现有模型在此场景下表现不佳。通过用户研究,我们识别了人类在直播审核中使用的信息上下文,并训练利用上下文识别规范违背的模型。我们的结果显示,恰当的上下文信息可将审核性能提升35%。

关键词

引用

@article{arxiv.2305.10731,
  title  = {Analyzing Norm Violations in Live-Stream Chat},
  author = {Jihyung Moon and Dong-Ho Lee and Hyundong Cho and Woojeong Jin and Chan Young Park and Minwoo Kim and Jonathan May and Jay Pujara and Sungjoon Park},
  journal= {arXiv preprint arXiv:2305.10731},
  year   = {2023}
}

备注

17 pages, 8 figures, 15 tables