中文

预测过去:利用 OCR 与机器学习估计历史评估记录

机器学习 2025-06-02 v1

摘要

尽管美国政府在 1930 年代的住房政策对种族财富差距的影响已有充分记录,但由于历史房产评估记录难以获取,学者们一直难以量化其确切的财务影响。许多县仍以实体格式存储这些记录,导致难以进行大规模定量分析。我们提出了一种供学者将历史住房评估数据数字化的方法,并将其应用于构建和发布一个县的数据集。从公开的扫描文档开始,我们手动标注了超过 12,000 处房产的房产卡,以训练和验证我们的方法。我们采用 OCR 为另外 50,000 处房产的数据进行标注,该方法基于结合经典计算机视觉技术与基于深度学习的 OCR 的两阶段方法。对于无法应用 OCR 的情况(例如无法获取扫描文档),我们展示了如何利用基于建筑特征数据的回归模型来估计历史价值,并测试了该模型对其他县的泛化能力。借助这些高性价比的工具,学者、社区活动家和政策制定者能够更好地分析和理解红线政策的深远历史影响。

关键词

引用

@article{arxiv.2505.24676,
  title  = {Predicting the Past: Estimating Historical Appraisals with OCR and Machine Learning},
  author = {Mihir Bhaskar and Jun Tao Luo and Zihan Geng and Asmita Hajra and Junia Howell and Matthew R. Gormley},
  journal= {arXiv preprint arXiv:2505.24676},
  year   = {2025}
}

备注

Accepted to COMPASS 2025