SaRoCo:在罗马尼亚语新闻文章新语料库上检测讽刺
计算与语言
2021-07-01 v3 机器学习
摘要
在本工作中,我们引入了一个用于罗马尼亚语新闻讽刺检测的语料库。我们从多个真实与讽刺新闻来源收集了 55,608 篇公开新闻文章,构成了无论何种语言下最大的讽刺检测语料库之一,也是罗马尼亚语的唯一此类语料库。我们提供了文本样本的官方划分,使得训练新闻文章与测试新闻文章来自不同来源,从而确保模型不会仅因过拟合而取得高性能。我们使用两个最先进的深度神经模型进行实验,为我们新语料库建立了一组强基线。我们的结果表明,罗马尼亚语讽刺检测的机器级准确率(测试集上低于 73%)与人类级准确率(87%)相比相当低,为未来研究留下了充足的改进空间。
引用
@article{arxiv.2105.06456,
title = {SaRoCo: Detecting Satire in a Novel Romanian Corpus of News Articles},
author = {Ana-Cristina Rogoz and Mihaela Gaman and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2105.06456},
year = {2021}
}
备注
Accepted at ACL 2021