面向伪影缓解与预训练模型优化的自然语言推理多尺度数据增强方法
计算与语言
2023-03-20 v4 应用统计
摘要
机器学习模型在基准自然语言处理(NLP)数据集上可以达到高性能,但在更具挑战性的设置中却会失败。我们在预训练模型于自然语言推理(NLI)中学习到数据集伪影时研究此问题,NLI 是研究一对文本序列之间逻辑关系的课题。我们提供多种技术用于分析和定位众包 Stanford Natural Language Inference(SNLI)语料库中的数据集伪影。我们研究了 SNLI 中数据集伪影的文体模式。为缓解数据集伪影,我们采用一种独特的多尺度数据增强技术,包含两个不同的框架:句子层级的行为测试检查表与词层级的词汇同义标准。具体而言,我们的组合方法增强了模型对扰动测试的抵抗能力,使其持续优于预训练基线。
引用
@article{arxiv.2212.08756,
title = {Multi-Scales Data Augmentation Approach In Natural Language Inference For Artifacts Mitigation And Pre-Trained Model Optimization},
author = {Zhenyuan Lu},
journal= {arXiv preprint arXiv:2212.08756},
year = {2023}
}