混合生成-对比表示学习
机器学习
2021-06-14 v1 人工智能
摘要
无监督表示学习近年来因能通过有效利用大规模无标签数据而具备强大的泛化能力而受到广泛关注。对此有两类主流方法:对比学习和生成式预训练,前者从实例级判别任务中学习表示,后者从估计似然中学习表示。这些看似正交的方法各有优缺点。对比学习倾向于提取语义信息并丢弃与物体分类无关的细节,使得表示对判别任务有效,但降低了对分布外数据的鲁棒性。另一方面,生成式预训练直接估计数据分布,因此表示往往鲁棒但对判别任务并非最优。在本文中,我们展示了可以通过混合训练方案兼得二者之长。具体而言,我们证明了使用对比损失和生成损失共同训练的基于 Transformer 的编码器-解码器架构,能够学习到高度判别性和鲁棒性的表示,且不损害生成性能。我们在多种任务上广泛验证了我们的方法。
引用
@article{arxiv.2106.06162,
title = {Hybrid Generative-Contrastive Representation Learning},
author = {Saehoon Kim and Sungwoong Kim and Juho Lee},
journal= {arXiv preprint arXiv:2106.06162},
year = {2021}
}
备注
15 pages, 8 figures