面向无标签分布外 HI 观测数据的宇宙学推断
天体物理仪器与方法
2025-02-12 v2 宇宙学与河外天体物理
摘要
我们提出了一种方法,用于解释两个具有不同分布的同一可观测量数据集之间的协变量偏移。这有助于提高在已知标签的分布内样本(ID)上训练的神经网络模型,在未知标签的分布外样本(OOD)上进行场水平宇宙学推断的泛化能力。我们使用来自 CAMELS 中两个模拟套件 IllustrisTNG 和 SIMBA 的 HI 图。我们考虑了两种不同技术,即对抗方法和最优传输,以适应一个目标网络,其初始权重来自在有标签数据集上预训练的源网络。结果显示,适应后,源编码器和目标编码器提取的显著特征在嵌入空间中良好对齐。这表明目标编码器通过对抗训练和最优传输学习了目标域的表示。此外,在我们分析中考虑的所有场景里,目标编码器在适应阶段无法访问任何标签(Ω_m),却能从分布外图中以 R^2 分数 ≥ 0.9 的高精度恢复潜在的 Ω_m,其表现与在监督学习设置下训练的源编码器相当。我们进一步测试了仅有少量分布外实例可用于训练时这些技术的可行性,发现目标编码器仍能合理恢复物质密度。我们的方法对于从即将到来的大尺度巡天中提取信息至关重要。
引用
@article{arxiv.2411.10515,
title = {Towards cosmological inference on unlabeled out-of-distribution HI observational data},
author = {Sambatra Andrianomena and Sultan Hassan},
journal= {arXiv preprint arXiv:2411.10515},
year = {2025}
}
备注
14 pages, 9 figures, 4 tables