用于讽刺检测的对抗训练:对混杂变量的控制
计算与语言
2019-03-04 v2
摘要
讽刺文章与常规新闻的自动检测对下游应用(例如知识库填充)以及增进对讽刺语言特征的理解具有重要意义。近期方法依赖于基于文章来源自动标注的语料库。我们假设这促使模型学习不同出版来源(如“The Onion”与“The Guardian”)的特征,而非讽刺的特征,从而导致对未见过的出版来源的泛化性能不佳。因此我们提出一种带有对抗分量以控制出版来源这一混杂变量的讽刺检测新模型。在一个从德国新闻收集的大型新数据集(我们向研究界公开)上,我们观察到讽刺分类性能相当,且如预期那样,对抗训练下出版分类性能显著下降。我们的分析表明,对抗分量对于模型学会关注讽刺的语言属性至关重要。
引用
@article{arxiv.1902.11145,
title = {Adversarial Training for Satire Detection: Controlling for Confounding Variables},
author = {Robert McHardy and Heike Adel and Roman Klinger},
journal= {arXiv preprint arXiv:1902.11145},
year = {2019}
}
备注
Accepted for publication at NAACL 2019