利用主动学习减少科学仿真中的长尾损失
机器学习
2022-01-11 v2
摘要
基于深度学习的模型正日益被用于仿真科学模拟以加速科学研究。然而,准确的监督深度学习模型需要大量标注数据,这往往成为使用神经网络的瓶颈。在这项工作中,我们利用一种称为核心集选择(core-set selection)的主动学习方法来根据预定义预算主动选择待标注数据用于训练。为了进一步提升模型性能并降低训练成本,我们还使用收缩扰动(shrink-and-perturb)技巧进行训练预热。我们在不同领域的两个案例研究上进行了测试,即天体物理中的星系晕占据分布建模和等离子体物理中的 X 射线发射光谱,结果令人鼓舞:与随机采样基线相比,我们取得了有竞争力的整体性能,更重要的是,以几乎无额外开销的成本成功减少了较大的绝对损失,即损失分布中的长尾。
引用
@article{arxiv.2111.08498,
title = {Reducing the Long Tail Losses in Scientific Emulations with Active Learning},
author = {Yi Heng Lim and Muhammad Firmansyah Kasim},
journal= {arXiv preprint arXiv:2111.08498},
year = {2022}
}
备注
8 pages, 4 figures