在问答中使用全息压缩嵌入
计算与语言
2020-07-16 v1 机器学习
摘要
词向量表示是深度学习自然语言处理模型的核心。这类向量存在多种形式,称为嵌入(embeddings),包括 word2vec 与 GloVe。嵌入在大型语料库上训练,并学习词在上下文中的用法,捕捉词之间的语义关系。然而,此类训练得到的语义处于独立词(称为词型)的层面,并且当例如一个词型既可以是名词也可以是动词时会产生歧义。在问答中,词性与命名实体类型十分重要,但在神经模型中编码这些属性会扩大输入的规模。本研究采用预训练嵌入的全息压缩,以与仅表示词元相同的维度来表示词元、其词性以及命名实体类型。在一个改进的问答循环深度学习网络中的实现表明,语义关系得以保留,并取得了强劲的性能。
引用
@article{arxiv.2007.07287,
title = {Using Holographically Compressed Embeddings in Question Answering},
author = {Salvador E. Barbosa},
journal= {arXiv preprint arXiv:2007.07287},
year = {2020}
}
备注
12 pages, 6 figures, 1 table, 9th International Conference on Advanced Information Technologies and Applications (ICAITA 2020), July 11~12, 2020, Toronto, Canada, Advanced Natural Language Processing Sub-Conference (AdNLP 2020)