TEOChat:用于时序地球观测数据的大型视觉语言助手
计算机视觉与模式识别
2025-01-28 v2 人工智能
机器学习
摘要
大型视觉和语言助手已为解释自然图像开辟了新的能力。但这些方法最近仅被适配用于地球观测数据,且仅能处理单张图像输入,这限制了其在许多实际任务中的应用。在本工作中,我们发展了一个名为 TEOChat 的新型视觉语言助手,可就地球观测数据的时序序列进行对话交互。为训练 TEOChat,我们精选了一个遵循指令的数据集,包含众多单图像和时序任务,包括建筑变更与损伤评估、语义变更检测以及时序场景分类。我们表明 TEOChat 能够完成各种空间与时序推理任务,显著优于之前的视觉语言助手,甚至在多个专门模型(这些模型针对特定任务进行训练)的性能上实现相当或更好的效果。此外,TEOChat 在变更检测和变更问答数据集上实现惊人的零样本性能,在多个时序任务上超越 GPT-4o 和 Gemini 1.5 Pro,在场景分类、视觉问答和图像描述等任务中也展现出优于相当单图像指令-following 模型的更强单图像能力。我们将公开发布数据、模型及代码,地址为 https://github.com/ermongroup/TEOChat。
引用
@article{arxiv.2410.06234,
title = {TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data},
author = {Jeremy Andrew Irvin and Emily Ruoyu Liu and Joyce Chuyi Chen and Ines Dormoy and Jinyoung Kim and Samar Khanna and Zhuo Zheng and Stefano Ermon},
journal= {arXiv preprint arXiv:2410.06234},
year = {2025}
}
备注
Published at ICLR 2025