Where Did Your Model Learn That? Label-free Influence for Self-supervised Learning
机器学习
2024-12-24 v1 计算机视觉与模式识别
摘要
自监督学习(SSL)已彻底革新了从大规模无标签数据集中进行学习,但关于预训练数据与所学表征之间内在关系的理解仍不充分。传统监督式学习受益于基于梯度的数据归因工具,如影响函数,可衡量单个数据点对模型预测的贡献。然而,现有影响函数的定义依赖标签,在 SSL 场景下难以适用。我们通过引入 Influence-SSL,一种针对 SSL 的 novel且无标签的影响函数方法来弥补这一差距。我们利用所学表征对数据增广的稳定性,以识别有助于解释模型预测的训练样本。我们提供理论基础和实证证据,表明 Influence-SSL 在分析预训练 SSL 模型方面具有实用性。我们的分析揭示了与监督模型相比,SSL 模型对有影响力的数据作出反应的方式存在显著差异。最后,我们通过在重复检测、离群点识别和公平性分析中的应用来验证 Influence-SSL 的有效性。代码已公开:https://github.com/cryptonymous9/Influence-SSL。
引用
@article{arxiv.2412.17170,
title = {Where Did Your Model Learn That? Label-free Influence for Self-supervised Learning},
author = {Nidhin Harilal and Amit Kiran Rege and Reza Akbarian Bafghi and Maziar Raissi and Claire Monteleoni},
journal= {arXiv preprint arXiv:2412.17170},
year = {2024}
}