中文

SaRoCo:在罗马尼亚语新闻文章新语料库上检测讽刺

计算与语言 2021-07-01 v3 机器学习

摘要

在本工作中,我们引入了一个用于罗马尼亚语新闻讽刺检测的语料库。我们从多个真实与讽刺新闻来源收集了 55,608 篇公开新闻文章,构成了无论何种语言下最大的讽刺检测语料库之一,也是罗马尼亚语的唯一此类语料库。我们提供了文本样本的官方划分,使得训练新闻文章与测试新闻文章来自不同来源,从而确保模型不会仅因过拟合而取得高性能。我们使用两个最先进的深度神经模型进行实验,为我们新语料库建立了一组强基线。我们的结果表明,罗马尼亚语讽刺检测的机器级准确率(测试集上低于 73%)与人类级准确率(87%)相比相当低,为未来研究留下了充足的改进空间。

关键词

引用

@article{arxiv.2105.06456,
  title  = {SaRoCo: Detecting Satire in a Novel Romanian Corpus of News Articles},
  author = {Ana-Cristina Rogoz and Mihaela Gaman and Radu Tudor Ionescu},
  journal= {arXiv preprint arXiv:2105.06456},
  year   = {2021}
}

备注

Accepted at ACL 2021