基于大语言模型的少样本回归:GeoReg用于社会经济估计
机器学习
2026-03-20 v2
摘要
社会经济指标,如地区GDP、人口和教育水平,对塑造政策决策和促进可持续发展至关重要。本研究介绍了GeoReg,这是一个回归模型,整合了包括卫星图像和基于网页的地理信息在内的多种数据源,用于估算这些指标,即使是在数据稀缺的地区,如发展中国家。我们的方法利用大语言模型的先验知识来解决标签数据稀缺的问题,使语言模型作为数据工程师,通过提取有信息的特征来实现在少样本设置下的有效估计。具体而言,我们的模型获取数据特征与目标指标之间的情境关系,将其相关性分类为正、负、混合或无关。然后将这些特征输入带有针对每个类别调整权重约束的线性估计器。为捕捉非线性模式,模型还识别有意义的特征交互并将其整合,包括非线性变换。在不同发展阶段的三个国家的实验中显示,我们的模型在估算社会经济指标方面优于基线方法,即使是在数据可用性有限的低收入国家也是如此。
引用
@article{arxiv.2507.13323,
title = {GeoReg: Weight-Constrained Few-Shot Regression for Socio-Economic Estimation using LLM},
author = {Kyeongjin Ahn and Sungwon Han and Seungeon Lee and Donghyun Ahn and Hyoshin Kim and Jungwon Kim and Jihee Kim and Sangyoon Park and Meeyoung Cha},
journal= {arXiv preprint arXiv:2507.13323},
year = {2026}
}
备注
10 pages, 9 figures, 4 tables