LLMSynthor:利用大语言模型合成宏对齐微记录
机器学习
2025-10-14 v2
摘要
宏对齐微记录对于社会科学和城市研究中的可信模拟至关重要。例如,流行病模型只有当individual-level mobility and contacts 镜像真实行为时才可靠,而聚合值则需匹配案例计数或旅行流等真实世界统计数据。然而,获取规模化的细粒度数据是不实际的,研究人员仅拥有宏层级数据。LLMSynthor 通过将预训练的大语言模型转化为宏感知模拟器来解决此问题,该模拟器生成与目标宏统计数据一致的真实微记录。它迭代构建合成数据集:在每一步中,大语言模型生成记录批次以最小化合成数据与目标聚合值之间的差异。将大语言模型视为非参数共价因子,允许模型捕捉变量之间真实的共同依赖性。为提高效率,LLMSynthor 提出的采样方法引导大语言模型提出针对性的记录批次,指定变量范围和数量,以高效纠正差异同时保持基于模型先验的真实性。跨领域(移动、电子商务、人口)的评估显示,LLMSynthor 在真实性、统计保真性和实用性方面均表现出色,广泛适用于经济学、社会科学和城市研究。
引用
@article{arxiv.2505.14752,
title = {LLMSynthor: Macro-Aligned Micro-Records Synthesis with Large Language Models},
author = {Yihong Tang and Menglin Kong and Junlin He and Tong Nie and Lijun Sun},
journal= {arXiv preprint arXiv:2505.14752},
year = {2025}
}