Galaxy Walker:用于星系尺度理解的几何感知视觉语言模型
机器学习
2025-05-27 v3 人工智能
计算机视觉与模式识别
摘要
现代视觉语言模型 (VLMs) 在其创立之初即在向量空间(特别是欧几里得空间)中发展了 patch embedding 和卷积主干网络。当将 VLMs 扩展至星系尺度以理解天文现象时,引入用于行星轨道的球面空间和用于黑洞的双曲空间带来了两个艰巨的挑战:a) 当前的预训练模型局限于欧几里得空间,而非全面的几何嵌入;b) 主流架构缺乏适用于各向异性物理几何的主干网络。在本文中,我们引入了 Galaxy-Walker,一种几何感知的 VLM,用于宇宙级视觉理解任务。我们提出了几何提示 (geometry prompt),通过在多尺度物理图上的不同空间中进行随机游走来生成几何 token,并提出了几何适配器 (geometry adapter),以混合专家 (mixture-of-experts) 的方式压缩和重塑空间各向异性。大量实验证明了我们方法的有效性,Galaxy-Walker 在星系属性估计( 分数高达 )和形态学分类任务(在具有挑战性的特征上 F1 提升高达 )中均实现了 SOTA 性能,显著优于领域特定模型和通用 VLMs。
引用
@article{arxiv.2503.18578,
title = {Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding},
author = {Tianyu Chen and Xingcheng Fu and Yisen Gao and Haodong Qian and Yuecen Wei and Kun Yan and Haoyi Zhou and Jianxin Li},
journal= {arXiv preprint arXiv:2503.18578},
year = {2025}
}
备注
CVPR(Highlight)