中文

语言信息引导变换(LIT):一种自动生成对比集的方法

计算与语言 2020-11-13 v3

摘要

尽管 BERT 和 RoBERTa 等大规模预训练语言模型在分布内测试集上取得了超越人类的性能,但其在分布外测试集(例如对比集)上的表现不佳。构建对比集通常需要人类专家标注,成本高昂且难以大规模创建。在本工作中,我们提出一种语言信息引导变换(LIT)方法以自动生成对比集,使实践者能够探索感兴趣的语言现象并组合不同现象。在 SNLI 和 MNLI 上运用我们的方法进行实验表明,当前预训练语言模型虽被称为包含充足语言知识,却在我们自动生成的对比集上表现挣扎。此外,我们通过将 LIT 应用于扩充训练数据来提升模型在对比集上的性能,且不影响其在原始数据上的表现。

关键词

引用

@article{arxiv.2010.08580,
  title  = {Linguistically-Informed Transformations (LIT): A Method for Automatically Generating Contrast Sets},
  author = {Chuanrong Li and Lin Shengshuo and Leo Z. Liu and Xinyi Wu and Xuhui Zhou and Shane Steinert-Threlkeld},
  journal= {arXiv preprint arXiv:2010.08580},
  year   = {2020}
}

备注

Appears at EMNLP BlackboxNLP Workshop 2020