中文

希望言论检测:和平之声的计算分析

计算机与社会 2020-02-25 v4 计算与语言 机器学习

摘要

近期普尔瓦马恐怖袭击(2019年2月14日,克什米尔普尔瓦马)引发了印度与巴基斯坦之间一系列升级事件,为其长达70年的克什米尔争端再添一笔。 ubiquitous社交媒体盛行的当下,核武国家从未如此接近战争。本文通过利用YouTube视频评论构建的大型语料库(2890个视频上总计204万条评论、791289名用户中的392460名用户发布的921235条英文评论)分析这一不断演变的国际危机。我们在文中的主要贡献有三方面。首先,我们观察到多语种词嵌入能揭示精确的语言聚类,并据此构建仅需极少标注的文档语言识别技术。我们展示了其在涉及多种低资源语言的各类数据集上的可行性与效用。其次,我们对亲和平与亲战争意图的时间趋势进行分析,观察到两国紧张局势达到顶峰时,语料中亲和平意图也处于最高点。最后,在两国处于全面战争边缘的政治紧张局势下的激烈讨论中,我们论证了自动识别可消解敌意的用户生成网络内容的重要性,并解决这一被称为希望言论检测(hope-speech detection)的预测任务。

关键词

引用

@article{arxiv.1909.12940,
  title  = {Hope Speech Detection: A Computational Analysis of the Voice of Peace},
  author = {Shriphani Palakodety and Ashiqur R. KhudaBukhsh and Jaime G. Carbonell},
  journal= {arXiv preprint arXiv:1909.12940},
  year   = {2020}
}

备注

Minor edits