fairDMS:通过数据与模型复用实现快速模型训练
机器学习
2022-08-15 v3
摘要
由于高达 TB/s 的数据速率,从 Linac Coherent Light Source(LCLS-II)和 Advanced Photon Source Upgrade(APS-U)等仪器产生的数据中快速提取可操作信息变得愈发困难。传统的基于物理的信息检索方法难以足够快地检测有趣事件,从而无法及时聚焦于罕见事件或纠正错误。机器学习(ML)方法通过学习廉价的代理分类器提供了一种有前景的替代方案,但当仪器或样品发生变化导致 ML 性能下降时,可能会灾难性失效。为克服此类困难,我们提出了一种新的数据存储与 ML 模型训练架构,旨在组织大量数据与模型,使得在检测到模型退化时,可快速查询先前的模型和/或数据,并检索更合适的模型针对新条件进行微调。我们表明,与当前最先进技术相比,我们的方法可实现高达 100 倍的数据标注加速、200 倍的训练速度提升,以及 92 倍的端到端模型更新时间加速。
引用
@article{arxiv.2204.09805,
title = {fairDMS: Rapid Model Training by Data and Model Reuse},
author = {Ahsan Ali and Hemant Sharma and Rajkumar Kettimuthu and Peter Kenesei and Dennis Trujillo and Antonino Miceli and Ian Foster and Ryan Coffee and Jana Thayer and Zhengchun Liu},
journal= {arXiv preprint arXiv:2204.09805},
year = {2022}
}