FreSaDa:用于跨领域讽刺检测的法语讽刺数据集
计算与语言
2021-05-18 v2 机器学习
摘要
本文介绍 FreSaDa,一个法语讽刺数据集(French Satire Data Set),由来自新闻领域的 11,570 篇文章组成。为避免由于学习到特定发布源的特征而报告不合理的高准确率,我们将样本划分为训练、验证与测试集,使得训练所用的发布源不同于验证与测试所用的发布源。这由此产生了一个跨领域(跨源)讽刺检测任务。我们采用两种分类方法作为该新数据集的基线:一种基于低级特征(字符 n-gram),另一种基于高级特征(CamemBERT 词嵌入的均值)。作为额外贡献,我们提出了一种无监督领域自适应方法,其将训练样本与验证样本之间的两两相似度(由点积给出)视为特征。通过引入这些领域特定特征,我们在字符 n-gram 与 CamemBERT 嵌入上均取得了显著提升。
引用
@article{arxiv.2104.04828,
title = {FreSaDa: A French Satire Data Set for Cross-Domain Satire Detection},
author = {Radu Tudor Ionescu and Adrian Gabriel Chifu},
journal= {arXiv preprint arXiv:2104.04828},
year = {2021}
}
备注
Accepted at IJCNN 2021