探索自动生成反事实数据在情感分析中的有效性
计算与语言
2022-03-25 v3 人工智能
计算机科学中的逻辑
摘要
尽管近年来最先进的 NLP 模型在广泛任务上取得了优异性能,但关于其鲁棒性以及对训练与测试数据中可能存在的系统性偏倚的潜在敏感性的重要问题正被提出。此类问题在面对领域外数据时表现为性能缺陷。近期一种解决方案是使用反事实增强数据集,以减少对原始数据中可能存在的虚假模式的依赖。生成高质量增强数据成本高且耗时,因为通常需要涉及人类反馈和众包工作。本工作中,我们提出一种替代方案,描述并评估一种用于数据增强与解释自动生成反事实数据的方法。在多个不同数据集上并使用多种最先进基准的综合评估表明,与在原始数据上训练的模型相比,甚至与借助人工生成增强数据训练的模型相比,我们的方法能在模型性能上取得显著提升。
引用
@article{arxiv.2106.15231,
title = {Exploring the Efficacy of Automatically Generated Counterfactuals for Sentiment Analysis},
author = {Linyi Yang and Jiazheng Li and Pádraig Cunningham and Yue Zhang and Barry Smyth and Ruihai Dong},
journal= {arXiv preprint arXiv:2106.15231},
year = {2022}
}
备注
Accepted to ACL-21