中文

基于重模拟的自监督学习用于基础模型预训练

高能物理 - 唯象学 2025-02-26 v2 机器学习 高能物理 - 实验

摘要

自监督学习(SSL)是现代大型机器学习模型训练的核心,提供了一种学习强大表示的方案,可用于各种下游任务。然而,SSL 策略必须适应训练数据类型和所需的下游任务。我们提出了 RS3L(“基于重模拟的自监督表示学习”),这是一种新颖的基于模拟的 SSL 策略,采用重模拟方法来驱动物理科学中对比学习的数据增强,特别是在依赖随机模拟器的领域。通过在模拟过程中间进行干预并重新运行干预下游的模拟组件,我们生成了事件的多个实现,从而产生了一组涵盖模拟器中所有物理驱动变化的增强数据。利用高能物理实验,我们探讨了该策略如何促进基础模型的开发;我们展示了 RS3L 预训练如何在区分各种对象和不确定性缓解等下游任务中实现强大的性能。除了我们的结果外,我们还公开了 RS3L 数据集,以供进一步研究如何改进 SSL 策略。

关键词

引用

@article{arxiv.2403.07066,
  title  = {Re-Simulation-based Self-Supervised Learning for Pre-Training Foundation Models},
  author = {Philip Harris and Michael Kagan and Jeffrey Krupa and Benedikt Maier and Nathaniel Woodward},
  journal= {arXiv preprint arXiv:2403.07066},
  year   = {2025}
}

备注

14 pages, 8 figures