中文

LUCAS-MEGA:用于土壤-环境系统表征学习的大规模多模态数据集

机器学习 2026-05-11 v2 数据库

摘要

土壤理解是农业、碳循环和环境可持续性的基础,但由于数据碎片化和异构性,进展受限,模型局限于小规模预测设置而无法进行高维表征学习。我们引入LUCAS-MEGA,一个通过系统性数据融合构建的大规模多模态数据集,以LUCAS调查为骨架。该融合数据集包含超过70,000个样本,涵盖超过1,000个特征,涵盖物理、化学、环境、生物和视觉属性,来自68个来源数据集。为实现大规模集成,我们开发了 SoilFuser,一个多智能体、人类在回路中的数据融合管道,对异构数据格式和测量协议进行标准化,解决不一致和无效条目(如单位不一致、码表不匹配和错误值), incorporates自然语言注释,并将多模态属性和元数据整合到统一、机器学习就绪的特征空间中。 resulting dataset captures key characteristics of real-world soil observations, including multimodality, uneven feature coverage, and heterogeneous uncertainty. 为展示LUCAS-MEGA数据驱动建模的可用性,我们使用基于特征遮蔽的自监督目标对多模态表格变换器(SoilFormer)进行预训练,实现了稳定的训练、强大的预测性能以及支持不确定性感知预测的表征。我们进一步展示,所学表征能够恢复与既定土壤过程一致的关系。LUCAS-MEGA以开放方式发布,并附带可组合、面向智能体的API,支持结构化查询和数据驱动工作流程。

关键词

引用

@article{arxiv.2605.04323,
  title  = {LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems},
  author = {Kuangdai Leng and Simon Jeffery and Panos Panagos and Tarje Nissen-Meyer},
  journal= {arXiv preprint arXiv:2605.04323},
  year   = {2026}
}

备注

27 pages, 7 figures, 1 table