自编码改进预训练词嵌入
计算与语言
2020-10-28 v2
摘要
先前研究预训练词嵌入几何性质的工作表明,词嵌入分布在狭窄的锥体中,通过中心化并使用主成分向量投影,可以提高给定预训练词嵌入集合的准确度。然而,理论上,该后处理步骤等价于应用线性自编码器以最小化平方l2重构误差。这一结果与时(Mu and Viswanath, 2018)提出的从预训练嵌入中移除顶部主成分的工作相矛盾。我们通过实验验证了我们的理论主张,并表明保留顶部主成分确实有助于改进预训练词嵌入,且无需访问额外的语言资源或标注数据。
引用
@article{arxiv.2010.13094,
title = {Autoencoding Improves Pre-trained Word Embeddings},
author = {Masahiro Kaneko and Danushka Bollegala},
journal= {arXiv preprint arXiv:2010.13094},
year = {2020}
}
备注
COLING 2020