中文

面向跨学科科学研究的统一多模态理解与生成模型

人工智能 2026-01-06 v1

摘要

科学发现日益依赖于跨学科整合异构高维数据。虽然 AI 模型在各科学领域取得了显著成就,但它们通常局限于特定领域,或缺乏同时理解和生成多模态科学数据的能力,尤其是针对高维数据。然而,许多紧迫的全球挑战和科学问题本质上是跨学科的,需要多个领域的协调性进展。本文提出了 FuXi-Uni,这是一个用于科学理解和跨科学领域高保真生成的原生统一多模态模型。具体而言,FuXi-Uni 将跨学科科学 token 对齐至自然语言 token 中,并采用科学解码器重建科学 token,从而支持自然语言对话和科学数值预测。经验上,我们在地球科学和生物医学领域验证了 FuXi-Uni。在地球系统建模中,该模型支持全球天气预报、热带气旋 (TC) 预报编辑和空间下采样,仅通过语言指令即可实现。在 0.25° 分辨率下生成的 10 天全球预报优于现行 SOTA 物理预报系统。它在 TC 轨迹和强度预测方面相对于现行 SOTA 物理模型表现优异,并生成的高分辨率区域气象场超越标准插值基准。在生物医学领域,FuXi-Uni 在多个生物医学视觉问答基准上超越了领先的多模态大语言模型。通过在保持强大领域特定性能的同时,将异构科学模态统一至原生共享潜在空间,FuXi-Uni 为更通用的多模态科学模型铺平了道路。

关键词

引用

@article{arxiv.2601.01363,
  title  = {A unified multimodal understanding and generation model for cross-disciplinary scientific research},
  author = {Xiaomeng Yang and Zhiyu Tan and Xiaohui Zhong and Mengping Yang and Qiusheng Huang and Lei Chen and Libo Wu and Hao Li},
  journal= {arXiv preprint arXiv:2601.01363},
  year   = {2026}
}