中文

社交媒体中上下文仇恨语音词汇的挖掘

计算与语言 2017-11-29 v1

摘要

社交媒体平台近期仇恨言论话语的出现频率上升,引发了对于改进检测方法的呼吁。此类方法多依赖标注数据、关键词与分类技术。尽管该方式覆盖良好,但在处理在线极端主义社群产生的新词时存在不足——这些词作为具有替代性仇恨语音含义词汇的原始来源。这些代号词(可为自创或借用词)旨在规避自动检测,且在日常话语中常具 benign 含义。例如,“skypes”“googles”与“yahoos”均属具有可用于仇恨言论的替代含义词汇实例。这种重叠在为仇恨言论专属数据收集及下游分类依赖关键词时引入了额外挑战。本工作中,我们开发了一种社群检测方法以寻找极端主义仇恨言论社群并从其成员处收集数据。我们还开发了学习词汇替代性仇恨语音含义的词嵌入模型,并通过若干标注实验展示代号词的候选性,实验旨在判定是否可能在不知其替代含义时识别某词被用于仇恨言论。我们报告的标注者间一致率分别为 K=0.871(极端主义社群数据)与 K=0.676(关键词方法),支持了仇恨言论检测系上下文任务、不依赖固定关键词列表的主张。我们的目标是通过提供高质量仇恨言论数据集及可输入现有分类方法以提升自动检测准确率的习得代号词,推进该领域发展。

关键词

引用

@article{arxiv.1711.10093,
  title  = {Surfacing contextual hate speech words within social media},
  author = {Jherez Taylor and Melvyn Peignon and Yi-Shin Chen},
  journal= {arXiv preprint arXiv:1711.10093},
  year   = {2017}
}