中文

用于上位词检测的数据增强

计算与语言 2021-01-25 v2 机器学习

摘要

上位词关系的自动检测是自然语言处理(NLP)中一个具有挑战性的问题。高质量训练数据的有限可用性普遍阻碍了使用分布式表示的最新监督方法的成功应用。我们开发了两种新颖的数据增强技术,它们能从现有训练样本中生成新的训练样本。首先,我们结合上位词传递性和交集修饰语-名词组合的语言学原理,生成额外的向量对,例如“小狗 - 狗”或“小狗 - 动物”,对于这些向量对,可以假定存在上位词关系。其次,我们使用生成对抗网络(GANs)来生成同样可以假定存在上位词关系的向量对。此外,我们还提出了两种互补策略,通过利用 WordNet 等语言资源来扩展现有数据集。通过在 3 个不同的上位词检测数据集和 2 种不同的向量空间上进行评估,我们证明了所提出的自动数据增强和数据集扩展策略都能显著提升分类器性能。

引用

@article{arxiv.2005.01854,
  title  = {Data Augmentation for Hypernymy Detection},
  author = {Thomas Kober and Julie Weeds and Lorenzo Bertolini and David Weir},
  journal= {arXiv preprint arXiv:2005.01854},
  year   = {2021}
}

备注

to appear at EACL 2021