中文

英语-印地语码混社交媒体的幽默检测:语料库与基线系统

计算与语言 2018-06-15 v1

摘要

过去十年中,社交网站产生的海量用户生成数据使得计算语言学领域中的自动文本分类日益流行。在该领域内,自动文本幽默检测这一问题引起了众多研究者的关注。检测幽默需要对文本进行深入的语义理解,这使得该问题难以自动化。随着社交媒体用户数量的增加,许多多语使用者在发布社交媒体内容时经常在不同语言间切换,这被称为码混(code-mixing)。它给社交媒体内容的语言学分析带来了一些挑战(Barman et al., 2014),例如句子中的拼写变体和非语法结构。以往的研究包括检测单语文本中的双关语(Kao et al., 2016)和单行幽默(Mihalcea et al., 2010),但随着网上可用的码混数据大量增加,有必要开发能够检测码混推文中幽默的技术。在本文中,我们分析了文本幽默检测任务,并描述了一个自由可用的语料库,其中包含标注为幽默(H)或非幽默(N)标签的英语-印地语码混推文。我们还用语言标签(英语/印地语/其他)对推文中的词进行了标注。此外,我们描述了在该语料库上进行的实验,并提供了一个区分幽默与非幽默文本的基线分类系统。

关键词

引用

@article{arxiv.1806.05513,
  title  = {Humor Detection in English-Hindi Code-Mixed Social Media Content : Corpus and Baseline System},
  author = {Ankush Khandelwal and Sahil Swami and Syed S. Akhtar and Manish Shrivastava},
  journal= {arXiv preprint arXiv:1806.05513},
  year   = {2018}
}

备注

5 pages, 1 figure, LREC 2018