中文

AllSpark:以语言为参考框架的十模态多模态时空通用智能模型

人工智能 2025-01-08 v3 机器学习

摘要

利用多模态数据是理解地理对象的内在要求。然而,由于各种时空模态在结构和语义上的高度异质性,多模态时空数据的联合解释长期以来一直是一个极具挑战性的问题。主要挑战在于在各种模态的内聚性与自主性之间取得平衡。随着模态数量的增加,这种平衡变得日益非线性。受人类认知系统和语言哲学的启发——即来自五感的感知信号汇聚为语言——我们引入了“语言作为参考框架”,这是构建多模态统一模型的基本原则。在此基础上,我们提出了 AllSpark,一个多模态时空通用人工智能模型。我们的模型将十种不同的模态整合到一个统一的框架中。为了实现模态内聚,AllSpark 引入了模态桥和多模态大语言模型(LLM),将不同的模态特征映射到语言特征空间中。为了保持模态自主性,AllSpark 使用特定模态的编码器来提取各种时空模态的 token。最后,鉴于模型的可解释性与下游任务之间存在差距,我们设计了特定模态的提示和任务头,增强了模型在特定任务上的泛化能力。实验表明,语言的引入使 AllSpark 能够在无需额外训练的情况下,在 RGB 和点云模态的小样本分类任务中表现出色,性能超过基线高达 41.82%。源代码可在 https://github.com/GeoX-Lab/AllSpark 获取。

关键词

引用

@article{arxiv.2401.00546,
  title  = {AllSpark: A Multimodal Spatio-Temporal General Intelligence Model with Ten Modalities via Language as a Reference Framework},
  author = {Run Shao and Cheng Yang and Qiujun Li and Qing Zhu and Yongjun Zhang and YanSheng Li and Yu Liu and Yong Tang and Dapeng Liu and Shizhong Yang and Haifeng Li},
  journal= {arXiv preprint arXiv:2401.00546},
  year   = {2025}
}

备注

19 pages, 19 tables, 3 figures