Twitter中的讽刺检测——使用数据增强:词嵌入时的性能影响
计算与语言
2023-02-07 v2 机器学习
摘要
讽刺是指通常使用词语来嘲弄或惹恼某人,或用于幽默目的。讽刺在社交网络与微博网站中被大量使用,人们以某种方式嘲讽或批评,以至于连人类都难以判断所言是否即所指。在自然语言处理应用(如情感分析与观点挖掘)中未能识别讽刺话语将混淆分类算法并产生错误结果。若干关于讽刺检测的研究已利用不同学习算法。然而,这些学习模型大多仅关注表达内容,将上下文信息孤立。结果,它们未能捕捉讽刺表达中的上下文信息。此外,一些研究使用的数据集存在不平衡,影响模型结果。本文提出一种使用RoBERTa的Twitter讽刺识别上下文模型,并通过对全局向量表示(GloVe)应用以构建词嵌入与上下文学习来扩增数据集,从而生成更多数据并平衡数据集。该技术的有效性在各种数据集与数据增强设置下进行了测试。特别地,在使用数据增强增加20%标记为讽刺的数据时,iSarcasm数据集上我们取得3.2%的性能提升,F值达40.4%,而未使用数据增强时为37.2%。
引用
@article{arxiv.2108.09924,
title = {Sarcasm Detection in Twitter -- Performance Impact while using Data Augmentation: Word Embeddings},
author = {Alif Tri Handoyo and Hidayaturrahman and Derwin Suhartono},
journal= {arXiv preprint arXiv:2108.09924},
year = {2023}
}
备注
7 pages, 4 figures