CityRiSE:基于强化学习的 Vision-Language 模型 urban socio-economic status 推理框架
计算机视觉与模式识别
2025-10-28 v1 人工智能
计算与语言
摘要
利用公开的大规模网络数据(如街景与卫星影像)进行城市社会经济感知,对实现全球可持续发展目标至关重要。随着大型视觉语言模型 (Large Vision-Language Models, LVLMs) 的兴起,解决此任务的新机遇通过将其视为多模态感知与理解问题而呈现。然而,近期研究表明 LVLMs 在从视觉数据中进行准确且可解释的社会经济预测方面仍面临挑战。为克服这些限制并最大化 LVLMs 的潜力,我们提出 CityRiSE 框架——一种通过纯强化学习 (RL) 实现 LVLM urban socio-economic status 推理的新方法。通过精心策划的多模态数据与可验证的奖励设计,我们的方法引导 LVLM 聚焦于语义上有意义的视觉线索,实现面向 generalist 社会经济状态预测的结构化、目标导向的推理。实验表明,CityRiSE 通过显现的推理过程显著优于现有基线,提升了预测准确率与跨不同城市情境下的泛化能力,尤其在对未见城市与未见指标的预测中表现突出。本工作凸显了将 RL 与 LVLMs 结合用于可解释且通用的城市社会经济感知的潜力。
引用
@article{arxiv.2510.22282,
title = {CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning},
author = {Tianhui Liu and Hetian Pang and Xin Zhang and Jie Feng and Yong Li and Pan Hui},
journal= {arXiv preprint arXiv:2510.22282},
year = {2025}
}