内存受限下深度对比学习批大小的可扩展性
机器学习
2021-06-16 v2 计算与语言
信息检索
摘要
对比学习已成功应用于学习文本的向量表示。先前的研究表明,学习高质量表示受益于具有大量负样本的批间对比损失。在实践中,使用了批内负样本(in-batch negative)技术,即对批中每个样本,将其他批样本的 positives 作为其负样本,从而避免编码额外的负样本。然而,这仍然使每个样本的损失依赖于所有批样本,并要求将整个大批量放入GPU内存中。本文引入了一种梯度缓存技术,解耦了对比损失与编码器之间的反向传播,消除了编码器反向传播沿批维度的数据依赖。因此,可以一次为批的一个子集计算梯度,从而实现近乎恒定的内存使用。
引用
@article{arxiv.2101.06983,
title = {Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup},
author = {Luyu Gao and Yunyi Zhang and Jiawei Han and Jamie Callan},
journal= {arXiv preprint arXiv:2101.06983},
year = {2021}
}
备注
RepL4NLP 2021