天文生物学基础模型:论文 I —— 工作坊与概述
天体物理仪器与方法
2025-10-13 v1 地球与行星天体物理
摘要
过去十年,机器学习的进步导致算法应用的激增,这些应用用于编码、特征化和处理可能包含大量高维特征的复杂数据。最近,基于非常大数据集训练的深度学习模型的出现,催生了以基础模型形式出现的机器学习新范式。基础模型是训练于非常大且广泛数据集、拥有大量参数的程序。一旦构建,这些强大且灵活的模型可以更少的资源方式构建许多不同的下游应用,以整合以前在数据上的离散特征。这些应用的开发可以快速进行,且对机器学习专业知识的需求大大降低。所需的基础设施和模型本身已经在如 NASA 和 ESA 等机构中建立。NASA 方面,这项工作跨越科学任务局面(Science Mission Directorate)的多个部门,包括 NASA Goddard 和 INDUS 大型语言模型以及 Prithvi 地理空间基础模型。ESA 将基础模型带到地球观测的倡议,导致开发了 TerraMind。2025 年 2 月,NASA Ames 研究中心与 SETI 研究所共同举办了一场工作坊,旨在调查基础模型在天文生物学研究中的潜力,并确定构建和利用此类模型或模型所需的步骤。本文分享了该工作坊的发现和建议,并描述了在天文生物学应用中开发(或多个)基础模型的明确中期及未来机遇。这些应用包括生物指纹或生命特征化任务、任务开发和运营任务,以及用于整合和支持天文生物学研究需求的自然语言任务。
引用
@article{arxiv.2510.08636,
title = {Foundation Models for Astrobiology: Paper I -- Workshop and Overview},
author = {Ryan Felton and Caleb Scharf and Stuart Bartlett and Nathalie A. Cabrol and Victoria Da Poian and Diana Gentry and Jian Gong and Adrienne Hoarfrost and Manil Maskey and Floyd Nichols and Conor A. Nixon and Tejas Panambur and Joseph Pasterski and Anton S. Petrov and Anirudh Prabhu and Brenda Thomson and Hamed Valizadegan and Kimberley Warren-Rhodes and David Wettergreen and Michael L. Wong and Anastasia Yanchilina},
journal= {arXiv preprint arXiv:2510.08636},
year = {2025}
}
备注
39 pages, 6 figures, 2 tables, 1 glossary, 4 supplemental pages