面向科学中数据稀缺应用的代理与不变性增强对比学习
机器学习
2022-08-24 v1 材料科学
应用物理
光学
摘要
深度学习技术已日益应用于自然科学,例如用于性质预测与优化或材料发现。此类方法的一个基本要素是训练模型所需的大量标注数据;这在数据稀缺场景下构成了严峻挑战,因为获取标签需要大量的计算或人力成本。在此,我们引入代理与不变性增强对比学习(SIB-CL),一种融合三种“廉价”且易获取的辅助信息源以克服数据稀缺的深度学习框架。具体而言,这些源为:1)丰富的无标签数据,2)关于对称性或不变性的先验知识,以及 3)以近乎零成本获得的代理数据。我们在各类科学问题上展示了 SIB-CL 的有效性与通用性,例如预测二维光子晶体的态密度以及求解三维定态薛定谔方程。SIB-CL 持续带来数量级级别的标签需求缩减,从而在相同网络精度下所需标签数大幅减少。
引用
@article{arxiv.2110.08406,
title = {Surrogate- and invariance-boosted contrastive learning for data-scarce applications in science},
author = {Charlotte Loh and Thomas Christensen and Rumen Dangovski and Samuel Kim and Marin Soljacic},
journal= {arXiv preprint arXiv:2110.08406},
year = {2022}
}
备注
21 pages, 10 figures