中文

利用噪声长标题超级监督提升城市图像中的区域表示学习

人工智能 2025-12-02 v2

摘要

区域表示学习在城市计算中发挥着关键作用,通过从无标签的城市数据中提取有意义的特征。类似地,人所感知的年龄反映了个体的健康状况,城市的视觉外观则是其“肖像”,封装了潜在的社会经济和环境特征。最近的研究尝试利用大语言模型(LLMs)将文本知识纳入基于图像的城市区域表示学习中。然而,仍面临两个主要挑战:i) 将细粒度视觉特征与长标题对齐;ii) 由于 LLM 生成的标题存在噪声,导致知识融合不佳。为此,我们提出一种新的预训练框架 UrbanLN,通过长文本感知和噪声抑制来提高城市区域表示学习。具体而言,我们引入一种信息保留的拉伸插值策略,将长标题与复杂城市场景中的细粒度视觉语义对齐。为有效从 LLM 生成的标题中挖掘知识并过滤噪声,我们提出了双层优化策略。数据层面,一个多模型协作管道自动生成多样且可靠的标题,无需人工干预。模型层面,我们采用基于动量的自蒸馈机制生成稳定的伪目标,促进在噪声条件下的稳健跨模态学习。广泛的实验在四个真实城市以及各种下游任务上表明,UrbanLN 的性能显著优于现有方法。

关键词

引用

@article{arxiv.2511.07062,
  title  = {Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision},
  author = {Yimei Zhang and Guojiang Shen and Kaili Ning and Tongwei Ren and Xuebo Qiu and Mengmeng Wang and Xiangjie Kong},
  journal= {arXiv preprint arXiv:2511.07062},
  year   = {2025}
}

备注

Accepted as a full paper by AAAI-26