中文

ETNLP:一种用于为下游任务选择预训练词嵌入的视觉辅助系统方法

计算与语言 2019-08-06 v2

摘要

鉴于许多近期先进的嵌入模型,为特定下游任务选择最适用的预训练词嵌入(又称词表示)模型并非易事。本文提出一种称为 ETNLP 的系统方法,用于提取、评估和可视化多组预训练词嵌入,以确定在下游任务中应使用哪些嵌入。在提取方面,我们提供一种方法来提取将用于下游任务的嵌入子集。在评估方面,我们使用输入的词类比列表分析预训练嵌入的质量。最后,我们在嵌入空间中可视化词表示以交互式探索嵌入词。我们在越南语预训练词嵌入模型上证明了所提方法的有效性,以选择适用于命名实体识别(NER)任务的模型。具体而言,我们创建了一个大型越南语词类比列表来评估和选择该任务的预训练嵌入模型。随后我们利用所选嵌入进行 NER 任务,并在该任务基准数据集上取得了新的最先进(SOTA)结果。我们还将该方法应用于另一隐私保障嵌入选择的下游任务,并表明它帮助用户快速选择最合适的嵌入。此外,我们使用所提系统方法创建了一个开源系统,以促进其他 NLP 任务的类似研究。源代码与数据可在 https://github.com/vietnlp/etnlp 获取。

关键词

引用

@article{arxiv.1903.04433,
  title  = {ETNLP: a visual-aided systematic approach to select pre-trained embeddings for a downstream task},
  author = {Xuan-Son Vu and Thanh Vu and Son N. Tran and Lili Jiang},
  journal= {arXiv preprint arXiv:1903.04433},
  year   = {2019}
}

备注

10 pages