经济史中如何应对机器学习偏差
综合经济学
2026-06-26 v1
摘要
机器学习(ML)已迅速变革经济史,降低了数字化、数据关联与插补成本,并使历史文本中的信息得以规模化使用。本文提供善用这些工具的实用指南。然而ML工具也带来了新问题。预测误差常与关心的协变量系统性相关,因此即便高度准确的模型也会扭曲、有时逆转系数,且标准验证无法察觉。鉴于ML工具对历史数据往往表现更差,该问题在经济史领域尤为严重。我们也给出了应对方案。我们展示近期去偏方法可在广泛应用中修正此类偏差,仅用小规模随机抽样的专家标注标签,同时保留大规模预测的效率。我们以三类ML任务分类法组织该领域,沿此综述文献,并指出去偏适用之处与以代理变量验证为唯一手段之处。最后就数字化、模型选择与可复现性给出最佳实践指引。
引用
@article{arxiv.2606.28063,
title = {How to deal with machine learning bias in economic history},
author = {Torben S. D. Johansen and Julius Koschnick and Christian Vedel},
journal= {arXiv preprint arXiv:2606.28063},
year = {2026}
}