通用与特定词嵌入在研究转化阶段分类中的效用
计算与语言
2018-07-11 v2 机器学习
摘要
传统的文本分类模型基于词袋假设,将文本简化为每个文档中的词频计数。诸如 word2vec 等近期算法能够利用上下文窗口,以完全无监督的方式学习词语间的语义和相似性,且速度远快于以往的方法。每个词被投影到向量空间中,使得具有相似含义的词(如“strong”和“powerful”)被投影到同一个广义欧几里得空间中。关于这些词嵌入的未解问题包括它们在各类分类任务中的效用,以及构建具有广泛功能的词嵌入所需的最佳属性与文档来源。在本研究中,我们展示了预训练词嵌入在我们的分类任务中的有效性,并证明在特定领域和任务下构建的定制词嵌入,相比于在新闻文章或 Wikipedia 等更通用数据上学习到的词嵌入,能够提升分类性能。
引用
@article{arxiv.1705.06262,
title = {Utility of General and Specific Word Embeddings for Classifying Translational Stages of Research},
author = {Vincent Major and Alisa Surkis and Yindalon Aphinyanaphongs},
journal= {arXiv preprint arXiv:1705.06262},
year = {2018}
}
备注
10 pages. Accepted to AMIA 2018 Annual Symposium, San Francisco, November 3-7, 2018