中文

深度学习任务中词嵌入初始化的探索

计算与语言 2017-11-28 v1

摘要

词嵌入是离散文本处理单元世界与神经网络连续可微世界之间的接口。在这项工作中,我们考察了深度网络中使用的嵌入的各种随机与预训练初始化方法,及其在采用循环与卷积架构的四个 NLP 任务上性能的影响。我们确认预训练嵌入略优于随机初始化,尤其考虑到学习速度。另一方面,只要方差保持足够低,我们没有看到各种随机初始化方法之间的显著差异。高方差初始化阻止网络利用嵌入空间,并迫使它使用其他自由参数来完成任务。我们通过观察词法关系学习中的性能,以及网络即便在固定随机嵌入下也能学到合理完成任务的事实,来支持这一假设。

关键词

引用

@article{arxiv.1711.09160,
  title  = {An Exploration of Word Embedding Initialization in Deep-Learning Tasks},
  author = {Tom Kocmi and Ondřej Bojar},
  journal= {arXiv preprint arXiv:1711.09160},
  year   = {2017}
}

备注

Accepted to ICON 2017