中文

CAREER:面向劳动序列数据的基座模型

机器学习 2024-03-01 v4 计量经济学

摘要

劳动经济学家通常通过对小型、精心构建的纵向调查数据集拟合预测模型来分析就业数据。尽管机器学习方法为这类问题提供了前景,但这些调查数据集太小而无法利用其优势。近年来,大规模在线简历数据集也已可用,提供了数百万个体职业轨迹的数据。然而,标准计量经济模型无法利用其规模,也无法将其纳入对调查数据的分析。为此我们开发了 CAREER,一个用于工作序列的基座模型(foundation model)。CAREER 首先拟合大规模被动收集的简历数据,然后对更小的、更精心整理的数据集进行微调以进行经济推断。我们将 CAREER 拟合于一份包含 2400 万条来自简历的工作序列的数据集,并在小型纵向调查数据集上对其调整。我们发现 CAREER 对工作序列形成了准确预测,在三个广泛使用的经济学数据集上优于计量经济基线。我们进一步发现 CAREER 可用于对其他下游变量形成良好预测。例如,将 CAREER 纳入工资模型比当前使用的计量经济模型提供了更好的预测。

关键词

引用

@article{arxiv.2202.08370,
  title  = {CAREER: A Foundation Model for Labor Sequence Data},
  author = {Keyon Vafa and Emil Palikot and Tianyu Du and Ayush Kanodia and Susan Athey and David M. Blei},
  journal= {arXiv preprint arXiv:2202.08370},
  year   = {2024}
}