CosmoCLIP:面向天文成像的大型视觉语言模型泛化框架
计算机视觉与模式识别
2024-11-22 v2
摘要
现有的视觉文本对比学习模型通过匹配配对的图像和标题嵌入并将不相关的配对分离开来,来增强表示的可迁移性并支持零样本预测。然而,天文图像-标签数据集的规模显著小于来自互联网的常规图像和标签数据集。我们提出了CosmoCLIP,一个针对预训练CLIP模型进行微调的天文图像-文本对比学习框架,采用SpaceNet和基于BLIP的标题。SpaceNet通过FLARE获得,包含约13k个最佳分布图像;BLIP充当丰富知识提取器。通过对比学习从这些SpaceNet和BLIP描述中获得的丰富语义,CosmoCLIP在各种领域内外任务上实现了卓越的泛化。我们的结果表明,CosmoCLIP是一个简单而强大的框架,在零样本分类和图像-文本检索任务中显著优于CLIP。
引用
@article{arxiv.2407.07315,
title = {CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging},
author = {Raza Imam and Mohammed Talha Alam and Umaima Rahman and Mohsen Guizani and Fakhri Karray},
journal= {arXiv preprint arXiv:2407.07315},
year = {2024}
}
备注
Accepted at SPAICE Conference, ECSAT, UK, 2024