“你真的意思是你说的那样吗?”:使用双语词嵌入的印地语-英语代码混合数据中的讽刺检测
计算与语言
2020-12-17 v3
摘要
随着世界各地人们对社交媒体平台使用的增加,许多新的有趣 NLP 问题已经出现。其中之一是社交媒体文本中讽刺的检测。我们提供了一个用于训练自定义词嵌入的推特语料库和一个标注用于讽刺检测的 Hinglish 数据集。我们提出一种基于深度学习的方法,利用从 FastText 和 Word2Vec 方法导出的双语词嵌入来解决印地语-英语代码混合推文中的讽刺检测问题。我们尝试了各种深度学习模型,包括 CNN、LSTM、双向 LSTM(带和不带注意力)。我们的深度学习模型能够超越所有最先进的性能,其中基于注意力的双向 LSTM 表现最佳,准确率达到 78.49%。
引用
@article{arxiv.2010.00310,
title = {"Did you really mean what you said?" : Sarcasm Detection in Hindi-English Code-Mixed Data using Bilingual Word Embeddings},
author = {Akshita Aggarwal and Anshul Wadhawan and Anshima Chaudhary and Kavita Maurya},
journal= {arXiv preprint arXiv:2010.00310},
year = {2020}
}