中文

贫困制图的柏拉图表征:统一的视觉-语言编码还是智能体诱导的新颖性?

人工智能 2025-11-24 v2

摘要

我们研究家庭财富等社会经济指标是否会在卫星图像(捕捉物理特征)和互联网文本(反映历史/经济叙事)中留下可恢复的印记。使用来自非洲社区的人口统计与健康调查(DHS)数据,我们将 Landsat 图像与基于位置/年份条件生成的 LLM 文本描述以及由 AI 搜索智能体从网络来源检索的文本相配对。我们开发了一个多模态框架,通过五条流水线预测家庭财富(国际财富指数): 作用于卫星图像的视觉模型, 仅使用位置/年份的 LLM, 搜索/合成网络文本的 AI 智能体, 联合图像-文本编码器, 所有信号的集成。我们的框架做出了三项贡献。首先,在财富预测中,融合视觉与智能体/LLM 文本的表现优于纯视觉基线(例如,在样本外划分中 R 平方为 0.77 对比 0.63),其中 LLM 内部知识被证明比智能体检索的文本更有效,提高了对跨国家和跨时间泛化的鲁棒性。其次,我们发现了部分表征趋同:来自视觉/语言模态的融合嵌入呈中度相关(对齐后中位余弦相似度为 0.60),表明存在物质福祉的共享潜在编码,同时保留了互补细节,这与柏拉图表征假说一致。尽管仅使用 LLM 的文本优于智能体检索的数据,这对我们的智能体诱导新颖性假说提出了挑战,但在某些划分中结合智能体数据带来的适度增益,微弱地支持了智能体收集的信息引入了静态 LLM 知识未能完全捕获的独特表征结构这一观点。第三,我们发布了一个大规模多模态数据集,包含超过 60,000 个与卫星图像、LLM 生成描述和智能体检索文本相关联的 DHS 簇。

关键词

引用

@article{arxiv.2508.01109,
  title  = {Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?},
  author = {Satiyabooshan Murugaboopathy and Connor T. Jerzak and Adel Daoud},
  journal= {arXiv preprint arXiv:2508.01109},
  year   = {2025}
}

备注

7 figures