CAISA 在 SemEval-2023 任务8:用于缓解因果声明识别中类不平衡的反事实数据增强
计算与语言
2023-06-02 v1 机器学习
摘要
类不平衡问题会导致机器学习模型在少数类以及整个数据集上产生不理想的表现。使用数据增强技术增加样本数量是解决该问题的一种方法。我们引入了一种通过动词替换的新颖反事实数据增强方法,用于医学声明的识别。此外,我们研究了该方法的影响,并将其与另外3种数据增强技术进行比较,表明所提方法能在少数类上带来显著的(相对)提升。
引用
@article{arxiv.2306.00346,
title = {CAISA at SemEval-2023 Task 8: Counterfactual Data Augmentation for Mitigating Class Imbalance in Causal Claim Identification},
author = {Akbar Karimi and Lucie Flek},
journal= {arXiv preprint arXiv:2306.00346},
year = {2023}
}