无监督上下文化文档表示
计算与语言
2021-09-23 v1 信息检索
机器学习
摘要
若干 NLP 任务需要文本文档的有效表示。Arora 等人(2017)证明,对词向量的简单加权平均常优于神经模型。SCDV(Mekala 等人,2017)通过对预计算词向量进行软稀疏聚类,将该方法从句子进一步扩展到文档。然而,这两种技术都忽略了词的 polysemy(一词多义)与上下文特性。本文中,我们通过提出 SCDV+BERT(ctxd) 来解决该问题,这是一种简单而有效的无监督表示,它将基于上下文的 BERT(Devlin 等人,2019)词嵌入用于词义消歧,与 SCDV 软聚类方法相结合。我们表明,在多个分类数据集上我们的嵌入优于原始 SCDV、预训练 BERT 及若干其他基线。我们还展示了我们的嵌入在其他任务(如概念匹配与句子相似度)上的有效性。此外,我们表明在有限数据与仅少量样本的场景下,SCDV+BERT(ctxd) 优于微调 BERT 及不同的嵌入方法。
引用
@article{arxiv.2109.10509,
title = {Unsupervised Contextualized Document Representation},
author = {Ankur Gupta and Vivek Gupta},
journal= {arXiv preprint arXiv:2109.10509},
year = {2021}
}
备注
9 Pages, 4 Figures, 7 tables, SustaiNLP2021 @ EMNLP-2021