中文

在翻译中学习:上下文化词向量

计算与语言 2018-06-21 v2 人工智能 机器学习

摘要

计算机视觉已经受益于使用在 ImageNet 等大型监督训练集上预训练的权重来初始化多个深层。自然语言处理(NLP)通常仅使用预训练词向量初始化深层模型的最低层。在本文中,我们使用在机器翻译(MT)任务上训练的注意力序列到序列模型中的深度 LSTM 编码器来对词向量进行上下文化。我们表明,在多种常见的 NLP 任务上,添加这些上下文向量(CoVe)比仅使用无监督词向量和字符向量能提升性能:情感分析(SST, IMDb)、问题分类(TREC)、蕴含(SNLI)和问答(SQuAD)。对于细粒度情感分析和蕴含,CoVe 将我们基线模型的性能提升到了当前最优水平。

关键词

引用

@article{arxiv.1708.00107,
  title  = {Learned in Translation: Contextualized Word Vectors},
  author = {Bryan McCann and James Bradbury and Caiming Xiong and Richard Socher},
  journal= {arXiv preprint arXiv:1708.00107},
  year   = {2018}
}