语言信息引导变换(LIT):一种自动生成对比集的方法
计算与语言
2020-11-13 v3
摘要
尽管 BERT 和 RoBERTa 等大规模预训练语言模型在分布内测试集上取得了超越人类的性能,但其在分布外测试集(例如对比集)上的表现不佳。构建对比集通常需要人类专家标注,成本高昂且难以大规模创建。在本工作中,我们提出一种语言信息引导变换(LIT)方法以自动生成对比集,使实践者能够探索感兴趣的语言现象并组合不同现象。在 SNLI 和 MNLI 上运用我们的方法进行实验表明,当前预训练语言模型虽被称为包含充足语言知识,却在我们自动生成的对比集上表现挣扎。此外,我们通过将 LIT 应用于扩充训练数据来提升模型在对比集上的性能,且不影响其在原始数据上的表现。
引用
@article{arxiv.2010.08580,
title = {Linguistically-Informed Transformations (LIT): A Method for Automatically Generating Contrast Sets},
author = {Chuanrong Li and Lin Shengshuo and Leo Z. Liu and Xinyi Wu and Xuhui Zhou and Shane Steinert-Threlkeld},
journal= {arXiv preprint arXiv:2010.08580},
year = {2020}
}
备注
Appears at EMNLP BlackboxNLP Workshop 2020