中文

用于自动识别新微量组分的机器学习方法

地球与行星天体物理 2020-12-16 v1 天体物理仪器与方法 机器学习

摘要

分析现代光谱数据集的主要困难之一在于数据量庞大。例如,在大气透射光谱中,ESA ExoMars2016 卫星(称为 Trace Gas Orbiter (TGO))上 NOMAD 仪器的太阳掩星通道(SO)自 2018 年 4 月任务开始至 2020 年 1 月 15 日已产生 \sim1000 万条光谱,分属 20000 个采集序列。其他数据集更大,Mars Express 上的 OMEGA 或 Mars Reconnaissance Orbiter 上的 CRISM 约有 \sim数十亿条光谱。通常,新谱线是在模型拟合与人工残差分析的漫长迭代过程后被发现的。本文我们提出一种基于无监督机器学习的新方法,以自动探测新微量组分。尽管精确量化不在范围内,该工具也可通过给出少量端元(“源”)及其丰度来快速概括数据集。我们用丰度与源光谱(端元)的线性混合来近似数据集的非线性。我们使用以非负矩阵分解形式的无监督源分离来估计这些量。若干方法在合成与模拟数据上测试。我们的方法专用于探测微量组分光谱而非精确量化。在合成示例中,该方法能在 10410^4 条中探测出以 100 条隐藏光谱形式存在的化合物,信噪比为噪声水平的 1.5 倍。针对 CH4_{4} 的 NOMAD-SO 模拟光谱结果显示,在有利条件下探测极限处于 100-500 ppt 范围。NOMAD-SO 真实火星数据结果显示,如预期 CO2_{2} 与 H2_{2}O 存在,但 CH4_{4} 缺失。不过,我们确认数据库中一组新的意外谱线,由 ACS 仪器团队归因于 CO2_{2} 磁偶极。

关键词

引用

@article{arxiv.2012.08175,
  title  = {Machine Learning for automatic identification of new minor species},
  author = {Frederic Schmidt and Guillaume Cruz Mermy and Justin Erwin and Severine Robert and Lori Neary and Ian R. Thomas and Frank Daerden and Bojan Ristic and Manish R. Patel and Giancarlo Bellucci and Jose-Juan Lopez-Moreno and Ann-Carine Vandaele},
  journal= {arXiv preprint arXiv:2012.08175},
  year   = {2020}
}

备注

26 pages, 10 figures