中文

如何训练你的耀斑预测模型:重新审视稀有事件的稳健采样

太阳与恒星天体物理 2021-05-26 v1 机器学习

摘要

我们通过对元数据特征时间序列的研究展示太阳耀斑预报的案例,将其视为一个显著的类不平衡且时间相干问题。借助空间天气分析用于太阳耀斑(SWAN-SF)基准数据集,充分利用太阳活动区中的耀斑前时间序列成为可能;该数据集为分区化的多变量时间序列集合,包含 4075 个活动区属性,跨越太阳动力学天文台(SDO)运行期的 9 年以上。我们展示了由时间序列预报中对连续性的需求所引发的时间相干性总体概念,并表明若未正确理解此效应可能会虚假提升模型性能。我们进一步解决稀有事件预测中另一已知挑战,即类不平衡问题。SWAN-SF 是适合此问题的数据集,其对 GOES M 级和 X 级耀斑的不平衡比为 60:1,对 X 级耀斑与无耀斑实例的比为 800:1。我们重温应对这些挑战的主要补救方法,并给出若干实验以阐明每种补救对性能的确切影响。此外,我们认识到一些基本数据操作任务如数据归一化和交叉验证也可能影响性能——我们也讨论这些问题。在此框架下,我们还回顾了作为耀斑预报任务中两种广泛使用的性能验证指标,真技能统计(TSS)与海克技能分数(HSS)的主要优缺点。总之,我们展示并倡导在时间序列预测相对时间点预测的优势,前提是上述挑战得到可度量且定量化的解决。

关键词

引用

@article{arxiv.2103.07542,
  title  = {How to Train Your Flare Prediction Model: Revisiting Robust Sampling of Rare Events},
  author = {Azim Ahmadzadeh and Berkay Aydin and Manolis K. Georgoulis and Dustin J. Kempton and Sushant S. Mahajan and Rafal A. Angryk},
  journal= {arXiv preprint arXiv:2103.07542},
  year   = {2021}
}

备注

The Astrophysical Journal Supplement series (2021)