IAEA聚变数据湖项目——通过开放科学与FAIR数据加速AI和大数据应用
等离子体物理
2026-04-03 v1 应用物理
摘要
AI在聚变领域的应用是一个日趋成熟的领域,作为代理模型和数字孪生发挥关键作用,以克服计算开销限制和表征不足的现象,并拓展实时应用的前景。IAEA通过AI for Fusion协调研究项目(CRP)支持这一活动,这是一项于2022年启动的五年计划,涉及11个国家的24个机构。一个关键目标是支持开发现代数据基础设施,以实现能够安全外推到未来聚变电厂参数空间的通用AI模型的开发。IAEA通过聚变数据湖项目积极为数据基础设施做出贡献。这是一个遵循FAIR数据原则支持AI工作流开发的现代数据平台。该平台包含三个主要组成部分:1. 国际数据目录;2. 集中式中期存储;以及3. 全球各种聚变数据平台的数据联邦。当前概念验证(PoC)通过与UKAEA的MAST数据目录集成,展示了数据编目和数据联邦能力。目前,PoC的第二阶段将通过集成两个额外的实验聚变装置目录来展示可扩展性。本报告呈现了项目高层概述,包括:技术架构与设计、合作与贡献以及PoC解决方案;数据与元数据模型开发与本体概念;以及数据治理与服务条款的方法。这说明了工作的方法、结果和方向,突出了通过提高众多国际实验数据集的可见性和可访问性为聚变界带来的巨大潜在价值。
引用
@article{arxiv.2604.01797,
title = {The IAEA Fusion Data Lake Project -- Accelerating AI and Big Data Applications through Open Science and FAIR Data},
author = {Daljeet Singh Gahle and Matteo Barbarino},
journal= {arXiv preprint arXiv:2604.01797},
year = {2026}
}
备注
6 pages, 1 figure, project report based on oral conference presentation given at the Sixth IAEA Technical Meeting on Fusion Data Processing, Validation, and Analysis