无标签自监督学习进度监控
机器学习
2024-09-11 v1 人工智能
摘要
自监督学习(SSL)是一种有效的方法,可利用无标签数据来学习可用于各种下游任务的高级嵌入空间。然而,现有方法要么在训练一个模型时监控编码器质量,要么用于比较几个已训练模型,仍然依赖于对标注数据的访问。当 SSL 方法应用于新数据域时,可能始终没有足够大的标注数据集。本研究提出了几个可用于无标签数据嵌入的评估指标,并通过与线性探针准度(一种利用标注数据集的常见指标)进行比较来检验其可行性。特别是,我们应用 -均值聚类并使用轮廓得分和聚类一致性度量聚类质量。我们还测量了嵌入分布的熵。我们发现,尽管随着网络训练进程的推进,簇的聚类程度更好地对应于ground truth 标注,但只有在使用 SimCLR 和 MoCo-v2 等 SSL 方法进行训练时,无标签聚类指标才与线性探针准度相关,而在 SimSiam 中则不相关。此外,尽管熵在某些情况下与 LP准度的相关性不强,这似乎是由于早期训练产生的不稳定性所致,该指标在学习的后期阶段稳定下来并变得更可靠。 Furthermore,尽管熵一般随学习进程的推进而减小,但在 SimSiam 中,这一趋势会反转。还需要更多研究来确定这种意外行为的原因。最后,我们发现虽然基于聚类的做法可能仅适用于相同架构的比较,但熵可能是与架构无关的。
引用
@article{arxiv.2409.06612,
title = {Label-free Monitoring of Self-Supervised Learning Progress},
author = {Isaac Xu and Scott Lowe and Thomas Trappenberg},
journal= {arXiv preprint arXiv:2409.06612},
year = {2024}
}