大语言模型能否可靠地变革基于多样化历史表格的面板数据构建?
综合经济学
2025-05-20 v1 经济学
摘要
多模态大语言模型为历史表格的数字化带来了分水岭式的变革,使得以领域专业知识而非技术技能为中心的低成本处理成为可能。我们基于一个全新的历史县级车辆登记面板数据,严格验证了一条基于大语言模型的处理流程。该流程的成本比外包低100倍,将关键解析错误率从40%降至0.3%,并且与人工验证的金标准数据匹配度达到 为98.6%。无论使用大语言模型数据还是金标准数据,对汽车普及的增长和持续性的分析在统计上均无显著差异。基于大语言模型的数字化解锁了复杂的历史表格,使得新的经济分析和更广泛的研究者参与成为可能。
引用
@article{arxiv.2505.11599,
title = {Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?},
author = {Verónica Bäcker-Peral and Vitaly Meursault and Christopher Severen},
journal= {arXiv preprint arXiv:2505.11599},
year = {2025}
}