中文

从葡萄牙语Twitter流中学习词嵌入:若干实践方面的研究

计算与语言 2017-09-05 v1 机器学习

摘要

本文描述了一项初步研究,旨在从葡萄牙语Twitter流中生成并分发大规模嵌入数据库。我们首先使用相对较小的样本进行实验,并关注三个挑战:训练数据量、词汇表大小以及内在评价指标。使用单个GPU,我们能够将词汇表大小从嵌入2048个词和50万训练样本扩展到超过1000万训练样本的32768个词,同时保持稳定的验证损失以及每轮训练时间近似线性的趋势。我们还观察到,对于每个词汇表大小,使用少于50\%的可用训练样本可能导致过拟合。内在评价的结果显示词汇表大小为32768个词时性能良好。然而,内在评价指标对其相应的余弦相似度阈值过于敏感,表明需要开发更广泛的指标来追踪进展。

关键词

引用

@article{arxiv.1709.00947,
  title  = {Learning Word Embeddings from the Portuguese Twitter Stream: A Study of some Practical Aspects},
  author = {Pedro Saleiro and Luís Sarmento and Eduarda Mendes Rodrigues and Carlos Soares and Eugénio Oliveira},
  journal= {arXiv preprint arXiv:1709.00947},
  year   = {2017}
}