中文

LINDA:用于自然语言处理中插值任务的无监督学习

计算与语言 2021-12-30 v1 机器学习

摘要

尽管 mixup 在数据增强中取得了成功,但由于自然语言的离散性和变长特性,其在自然语言处理(NLP)任务中的适用性一直受到限制。因此,近期的研究依赖领域特定的启发式方法和人工构建的资源(如词典)来将 mixup 应用于 NLP。在本文中,我们转而提出一种用于数据增强的文本插值无监督学习方法,称之为“Learning to INterpolate for Data Augmentation”(LINDA),它不需要任何启发式方法或人工构建的资源,而是学习在自然语言流形上对任意一对自然语言句子进行插值。在通过实证展示 LINDA 的插值能力后,我们表明 LINDA 确实使我们能够在 NLP 中无缝应用 mixup,并在文本分类任务中带来更好的域内与域外泛化能力。

关键词

引用

@article{arxiv.2112.13969,
  title  = {LINDA: Unsupervised Learning to Interpolate in Natural Language Processing},
  author = {Yekyung Kim and Seohyeong Jeong and Kyunghyun Cho},
  journal= {arXiv preprint arXiv:2112.13969},
  year   = {2021}
}