中文

语言建模中的单样本学习

计算与语言 2020-07-21 v1 机器学习

摘要

人类即使首次读到或听到某个词,也能利用周围词的句法和语义推断其大量含义,并将习得的词义泛化到新任务。尽管在特定任务上已取得人类水平性能的重大进展(Silver et al., 2016),但从单或极少样本学习仍是机器学习的关键挑战,且在自然语言处理(NLP)中尚未被深入探索。本文通过借鉴机器学习近期进展中的思想——嵌入、注意力机制(softmax)和相似度度量(余弦、欧氏、Poincare和Minkowski)——来解决NLP任务的单样本学习问题。我们改编了匹配网络(Vinyals et al., 2016)提出的框架,并利用WikiText-2数据集,在(Vinyals et al., 2016)探讨的预测缺失词任务上,探究上述方法在单、双和三样本学习问题中的有效性。我们的工作有两方面贡献:第一,我们探究了不同距离度量对k样本学习的有效性,表明不存在单一最优距离度量,这挑战了普遍看法;我们发现距离度量的性能取决于训练时所用样本数。第二,我们在一个公开可用数据集上建立了语言任务单、双和三样本学习的基准,可供未来研究对比评测。

关键词

引用

@article{arxiv.2007.09679,
  title  = {One-Shot Learning for Language Modelling},
  author = {Talip Ucar and Adrian Gonzalez-Martin and Matthew Lee and Adrian Daniel Szwarc},
  journal= {arXiv preprint arXiv:2007.09679},
  year   = {2020}
}