中文

iSarcasm:一个意图讽刺数据集

计算与语言 2020-05-05 v2

摘要

我们在文本讽刺检测的背景下考虑意图讽刺与感知讽刺之间的区别。前者发生在话语从其作者角度看是讽刺性的时候,而后者发生在话语被受众解读为讽刺性的时候。我们展示了先前标注方法在捕捉意图讽刺方面的局限性,并引入了由作者直接标注讽刺的推文数据集 iSarcasm。在我们的数据集上考察最先进的讽刺检测模型,显示出相较于先前研究的数据集更低的性能,这表明这些数据集可能存在偏差或过于明显,且讽刺迄今为止可能是一个计算上研究不足的现象。通过提供 iSarcasm 数据集,我们旨在鼓励未来的 NLP 研究开发用于检测文本中由作者意图的讽刺的方法,而非基于我们证明为次优的假设所标注的讽刺。

关键词

引用

@article{arxiv.1911.03123,
  title  = {iSarcasm: A Dataset of Intended Sarcasm},
  author = {Silviu Oprea and Walid Magdy},
  journal= {arXiv preprint arXiv:1911.03123},
  year   = {2020}
}

备注

9 pages