中文

面向自监督学习的矩阵信息论

机器学习 2024-09-17 v7 人工智能 计算机视觉与模式识别

摘要

最大熵编码框架为 SimSiam、Barlow Twins 和 MEC 等许多非对比学习方法提供了统一的视角。受该框架启发,我们提出 Matrix-SSL,一种利用矩阵信息论将最大熵编码损失解释为矩阵均匀性损失的新方法。此外,Matrix-SSL 通过无缝引入矩阵对齐损失来增强最大熵编码方法,直接对齐不同分支中的协方差矩阵。实验结果表明,在线性评估设置下的 ImageNet 数据集以及 MS-COCO 的迁移学习任务上,Matrix-SSL 优于最先进的方法。具体而言,在 MS-COCO 上进行迁移学习时,我们的方法仅用 400 轮预训练便以高达 3.3% 的优势超越 MoCo v2 和 BYOL 等先前 SOTA 方法(后者需 800 轮)。我们还尝试通过将矩阵交叉熵损失用于微调一个 7B 模型,把表示学习引入语言建模领域,在 GSM8K 数据集上相比标准交叉熵损失有 3.1% 的提升。代码见 https://github.com/yifanzhang-pro/Matrix-SSL。

关键词

引用

@article{arxiv.2305.17326,
  title  = {Matrix Information Theory for Self-Supervised Learning},
  author = {Yifan Zhang and Zhiquan Tan and Jingqin Yang and Weiran Huang and Yang Yuan},
  journal= {arXiv preprint arXiv:2305.17326},
  year   = {2024}
}