A La Carte 嵌入:廉价而高效的语义特征向量归纳
计算与语言
2018-05-16 v1 人工智能
摘要
领域自适应、迁移学习和特征学习等动机激发了对罕见或未见词、n-gram、同义词集及其他文本特征的嵌入归纳的兴趣。本文介绍 a la carte 嵌入,这是一种简单且通用的替代通常基于 word2vec 构建此类表示的方法,其基于近期针对类 GloVe 嵌入的理论结果。我们的方法主要依赖一个线性变换,可使用预训练词向量和线性回归高效学习。该变换在未来遇到新文本特征或罕见词时可即时应用,即使仅有一个使用样例也可用。我们引入一个新数据集,展示 a la carte 方法需要更少的上下文词例来学习高质量嵌入,并在一个 nonce 任务和一些无监督文档分类任务上取得了 state-of-the-art 结果。
引用
@article{arxiv.1805.05388,
title = {A La Carte Embedding: Cheap but Effective Induction of Semantic Feature Vectors},
author = {Mikhail Khodak and Nikunj Saunshi and Yingyu Liang and Tengyu Ma and Brandon Stewart and Sanjeev Arora},
journal= {arXiv preprint arXiv:1805.05388},
year = {2018}
}
备注
11 pages, 2 figures, To appear in ACL 2018