iSarcasm:一个意图讽刺数据集
计算与语言
2020-05-05 v2
摘要
我们在文本讽刺检测的背景下考虑意图讽刺与感知讽刺之间的区别。前者发生在话语从其作者角度看是讽刺性的时候,而后者发生在话语被受众解读为讽刺性的时候。我们展示了先前标注方法在捕捉意图讽刺方面的局限性,并引入了由作者直接标注讽刺的推文数据集 iSarcasm。在我们的数据集上考察最先进的讽刺检测模型,显示出相较于先前研究的数据集更低的性能,这表明这些数据集可能存在偏差或过于明显,且讽刺迄今为止可能是一个计算上研究不足的现象。通过提供 iSarcasm 数据集,我们旨在鼓励未来的 NLP 研究开发用于检测文本中由作者意图的讽刺的方法,而非基于我们证明为次优的假设所标注的讽刺。
关键词
引用
@article{arxiv.1911.03123,
title = {iSarcasm: A Dataset of Intended Sarcasm},
author = {Silviu Oprea and Walid Magdy},
journal= {arXiv preprint arXiv:1911.03123},
year = {2020}
}
备注
9 pages