Visual Chronicles:使用多模态大语言模型分析海量图像集合
计算机视觉与模式识别
2025-09-24 v3 人工智能
计算机与社会
摘要
我们提出了一种利用多模态大语言模型(MLLM)分析大型数据库的系统,该数据库包含数千万张在不同时间捕获的图像,旨在发现时间变化中的模式。具体而言,我们旨在捕捉城市在一定时段内频繁出现的共现变化(“趋势”)。与以往的视觉分析不同,我的分析回答开放性查询(例如:“城市中频繁出现的变化类型是什么?”),且没有预设的目标主题或训练标签。这种属性使先前的基于学习或无监督视觉分析工具不适用。我们确定 MLLM 作为一种新型工具,其开放式语义理解能力令人印象深刻。然而,我们的数据集规模是 MLLM 所能吸收为上下文的四个数量级。因此,我们引入一种自下而上的方法,将海量视觉分析问题分解为更可处理的子问题。我们仔细设计 MLLM 解决方案以解决每个子问题。在实验和消融研究中,我们发现该系统显著优于基线方法,能够从大城市捕获的图像中发现有趣的趋势(例如:“户外用餐设施的增加”、“越墙被涂成蓝色”等)。更多结果和交互演示请参见 https://boyangdeng.com/visual-chronicles。
引用
@article{arxiv.2504.08727,
title = {Visual Chronicles: Using Multimodal LLMs to Analyze Massive Collections of Images},
author = {Boyang Deng and Songyou Peng and Kyle Genova and Gordon Wetzstein and Noah Snavely and Leonidas Guibas and Thomas Funkhouser},
journal= {arXiv preprint arXiv:2504.08727},
year = {2025}
}
备注
ICCV 2025, Project page: https://boyangdeng.com/visual-chronicles , second and third listed authors have equal contributions