中文

不远不近:基于 MiniMax 的样本高效最近邻数据增强

计算与语言 2021-06-03 v2 机器学习

摘要

在自然语言处理(NLP)中,寻找能够生成高质量、可被人理解示例的数据增强技术一直具有挑战性。近来,利用 kNN 从大规模无标注句子库中检索增强示例,朝可解释增强迈出了一步。受此范式启发,我们提出 Minimax-kNN,一种专为知识蒸馏(KD)定制的样本高效数据增强策略。我们采用基于 KD 的半监督方法在增强数据上训练模型。与现有盲目纳入所有样本的 kNN 增强技术不同,我们的方法动态选择一组最大化教师模型与学生模型间 KL 散度的增强样本子集。该步骤旨在提取最高效的样本,以确保我们的增强数据覆盖输入空间中损失值最大的区域。我们在若干文本分类任务上评估了该技术,结果表明 Minimax-kNN 持续优于强基线。我们的结果显示,相较于最先进的基于 kNN 的增强技术,Minimax-kNN 仅需更少的增强样本与更少的计算即可取得更优性能。

关键词

引用

@article{arxiv.2105.13608,
  title  = {Not Far Away, Not So Close: Sample Efficient Nearest Neighbour Data Augmentation via MiniMax},
  author = {Ehsan Kamalloo and Mehdi Rezagholizadeh and Peyman Passban and Ali Ghodsi},
  journal= {arXiv preprint arXiv:2105.13608},
  year   = {2021}
}

备注

Findings of ACL 2021