中文

用于讽刺检测的新闻标题数据集

计算与语言 2022-12-13 v1

摘要

过去的讽刺检测研究大多使用基于哈希标签监督收集的Twitter数据集,但此类数据集在标签和语言方面存在噪声。此外,许多推文是对其他推文的回复,检测其中的讽刺需要上下文推文的可用性。为克服Twitter数据集噪声相关的局限,我们从两个新闻网站整理了新闻标题数据集:TheOnion旨在制作当前事件的讽刺版本,而HuffPost发布真实新闻。该数据集包含约28K条标题,其中13K条为讽刺性标题。为使其更有用,我们包含了新闻文章的来源链接,以便根据需要提取更多数据。在本文中,我们描述了关于该数据集的各种细节以及除讽刺检测外的潜在用例。

关键词

引用

@article{arxiv.2212.06035,
  title  = {News Headlines Dataset For Sarcasm Detection},
  author = {Rishabh Misra},
  journal= {arXiv preprint arXiv:2212.06035},
  year   = {2022}
}