基于对比增强的无监督文档嵌入
计算与语言
2021-03-29 v1
摘要
我们提出一种结合数据增强技术的对比学习方法,以无监督方式学习文档表示。受近期用于图像与 NLP 预训练的对比自监督学习算法启发,我们假设高质量文档嵌入应对保留原文档语义的多种释义保持不变。借助不同的骨干网络与对比学习框架,我们的研究揭示了对比增强对文档表示学习的巨大益处,并给出两点额外见解:1)以对比方式引入数据增强可显著提升无监督文档表示学习中的嵌入质量;2)一般而言,通过简单词级操作生成的随机增强远优于句级与文档级增强。我们将方法嵌入分类器,并在六个基准数据集上与广泛基线方法比较。在文档分类任务上,我们的方法相较 SOTA 方法可将分类错误率降低多达 6.4%,达到甚至超越全监督方法。
引用
@article{arxiv.2103.14542,
title = {Unsupervised Document Embedding via Contrastive Augmentation},
author = {Dongsheng Luo and Wei Cheng and Jingchao Ni and Wenchao Yu and Xuchao Zhang and Bo Zong and Yanchi Liu and Zhengzhang Chen and Dongjin Song and Haifeng Chen and Xiang Zhang},
journal= {arXiv preprint arXiv:2103.14542},
year = {2021}
}
备注
13 pages; under review