中文

用于讽刺检测的英印混合代码推特语料库

计算与语言 2018-05-31 v1

摘要

推特和脸书等社交媒体平台已成为人们表达对各类话题看法的最大媒介之二。此类海量用户数据的产生使得情感分析和观点挖掘等 NLP 任务更为重要。在社交媒体文本中使用讽刺近来已成为一种流行趋势。使用讽刺会反转文本所暗示的含义与极性,这给许多 NLP 任务带来挑战。文本讽刺检测任务对商业和安全服务正变得愈发重要。我们提出首个英印混合代码推文数据集,标注了讽刺与反讽的存在,且每个词元也标注了语言标签。我们提出一个使用相同数据集开发的基线监督分类系统,在采用随机森林分类器并进行 10 折交叉验证后平均 F 值达 78.4。

关键词

引用

@article{arxiv.1805.11869,
  title  = {A Corpus of English-Hindi Code-Mixed Tweets for Sarcasm Detection},
  author = {Sahil Swami and Ankush Khandelwal and Vinay Singh and Syed Sarfaraz Akhtar and Manish Shrivastava},
  journal= {arXiv preprint arXiv:1805.11869},
  year   = {2018}
}

备注

9 pages, CICLing 2018