中文

作为核近似的对比学习

机器学习 2023-09-07 v1

摘要

在标准监督机器学习中,有必要为数据中的每个输入提供标签。尽管许多应用领域的原始数据可轻易从互联网获取,但对此类数据进行人工标注成本高昂。为规避此问题,对比学习方法在大型无标签数据集上生成高维输入的低维向量表示(也称为特征)。这是通过对比损失函数训练实现的,该函数强制相似输入在特征空间中具有高内积、不相似输入具有低内积。无需逐个标注每个输入,只需定义一种采样相似与不相似输入对的方法即可。随后可将对比特征作为监督学习系统在小得多的人工标注数据集上的输入,从而在感兴趣的最终任务上获得高准确率。本论文旨在概述当前对对比学习的理论理解,特别是关于对比损失函数极小化器及其与先前从无标签数据学习特征方法的关系。我们强调流行的对比损失函数,其极小化器隐式近似一个正半定(PSD)核。后者是泛函分析和学习理论中研究完备的对象,形式化了空间中元素间相似性的概念。PSD 核通过再生核希尔伯特空间理论隐式定义特征。

关键词

引用

@article{arxiv.2309.02651,
  title  = {Contrastive Learning as Kernel Approximation},
  author = {Konstantinos Christopher Tsiolis},
  journal= {arXiv preprint arXiv:2309.02651},
  year   = {2023}
}

备注

Master's (M.Sc.) Thesis