中文

自编码改进预训练词嵌入

计算与语言 2020-10-28 v2

摘要

先前研究预训练词嵌入几何性质的工作表明,词嵌入分布在狭窄的锥体中,通过中心化并使用主成分向量投影,可以提高给定预训练词嵌入集合的准确度。然而,理论上,该后处理步骤等价于应用线性自编码器以最小化平方l2重构误差。这一结果与时(Mu and Viswanath, 2018)提出的从预训练嵌入中移除顶部主成分的工作相矛盾。我们通过实验验证了我们的理论主张,并表明保留顶部主成分确实有助于改进预训练词嵌入,且无需访问额外的语言资源或标注数据。

关键词

引用

@article{arxiv.2010.13094,
  title  = {Autoencoding Improves Pre-trained Word Embeddings},
  author = {Masahiro Kaneko and Danushka Bollegala},
  journal= {arXiv preprint arXiv:2010.13094},
  year   = {2020}
}

备注

COLING 2020