基于 BERT 与数据增强的自监督文档聚类
计算与语言
2021-09-20 v3 人工智能
摘要
对比学习是一种有前景的无监督学习方法,因为它继承了经过充分研究的深度模型的优势,而无需专门且复杂的模型设计。在本文中,基于双向编码器表示来自变换器(bidirectional encoder representations from transformers, BERT),我们提出了自监督对比学习(SCL)以及带有无监督数据增强(UDA)的少样本对比学习(FCL)用于文本聚类。在多项聚类评价指标上,SCL 优于最先进的(SOTA)短文本无监督聚类方法和长文本无监督聚类方法。FCL 取得了接近监督学习的性能,而带有 UDA 的 FCL 进一步提升了短文本的性能。
引用
@article{arxiv.2011.08523,
title = {Self-supervised Document Clustering Based on BERT with Data Augment},
author = {Haoxiang Shi and Cen Wang},
journal= {arXiv preprint arXiv:2011.08523},
year = {2021}
}