语言建模中的单样本学习
计算与语言
2020-07-21 v1 机器学习
摘要
人类即使首次读到或听到某个词,也能利用周围词的句法和语义推断其大量含义,并将习得的词义泛化到新任务。尽管在特定任务上已取得人类水平性能的重大进展(Silver et al., 2016),但从单或极少样本学习仍是机器学习的关键挑战,且在自然语言处理(NLP)中尚未被深入探索。本文通过借鉴机器学习近期进展中的思想——嵌入、注意力机制(softmax)和相似度度量(余弦、欧氏、Poincare和Minkowski)——来解决NLP任务的单样本学习问题。我们改编了匹配网络(Vinyals et al., 2016)提出的框架,并利用WikiText-2数据集,在(Vinyals et al., 2016)探讨的预测缺失词任务上,探究上述方法在单、双和三样本学习问题中的有效性。我们的工作有两方面贡献:第一,我们探究了不同距离度量对k样本学习的有效性,表明不存在单一最优距离度量,这挑战了普遍看法;我们发现距离度量的性能取决于训练时所用样本数。第二,我们在一个公开可用数据集上建立了语言任务单、双和三样本学习的基准,可供未来研究对比评测。
引用
@article{arxiv.2007.09679,
title = {One-Shot Learning for Language Modelling},
author = {Talip Ucar and Adrian Gonzalez-Martin and Matthew Lee and Adrian Daniel Szwarc},
journal= {arXiv preprint arXiv:2007.09679},
year = {2020}
}