提高最大流形容量表示理解与利用的努力
机器学习
2024-06-14 v1 计算机视觉与模式识别
神经元与认知
摘要
最大流形容量表示(MMCR)是一种最近的多视图自监督学习(MVSSL)方法,其性能可匹配或超过其他领先的 MVSSL 方法。MMCR 因不符合常见的多视图自监督学习主流范式而颇具新意,其源自对数据流形线性可分性的统计力学视角。本文旨在更好地理解和利用 MMCR。为更好地理解 MMCR,我们利用高维概率工具表明 MMCR 对学习得到的嵌入具有一致性和均匀性的激励。随后,我们利用信息论工具表明此类嵌入最大化了关于视图之间互信息的著名下界,从而将 MMCR 的几何视角与 MVSSL 中常见的信息论视角联系起来。为更好地利用 MMCR,我们数学预测并实验确认预训练损失随异常超参数发生非单调变化——类似于双下降,但针对特定超参数。我们还发现计算扩展规律,可预测预训练损失随梯度步数、批量大小、嵌入维度和视图数量的变化。随后我们表明 MMCR 原本用于图像数据,在多模态图像-文本数据上也表现出色。通过更深入地理解 MMCR 的理论和实证行为,本工作揭示了改进 MVSSL 方法的洞见。
引用
@article{arxiv.2406.09366,
title = {Towards an Improved Understanding and Utilization of Maximum Manifold Capacity Representations},
author = {Rylan Schaeffer and Victor Lecomte and Dhruv Bhandarkar Pai and Andres Carranza and Berivan Isik and Alyssa Unell and Mikail Khona and Thomas Yerxa and Yann LeCun and SueYeon Chung and Andrey Gromov and Ravid Shwartz-Ziv and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2406.09366},
year = {2024}
}