从 NLx 语料库提取 O*NET 特征以构建公共用聚合劳动市场数据
计算机与社会
2025-10-03 v1 计算与语言
摘要
在线职位信息数据难以获取,且未以标准或透明的方式构建。O*NET 标准分类和职业信息数据库中的数据更新不频繁,基于小型抽样调查。我们采用 O*NET 作为构建自然语言处理工具的框架,用于从职位招聘信息中提取结构化信息。我们发布了 Job Ad Analysis Toolkit (JAAT),一套为此目的而构建的开源工具,并在 out-of-sample 和 LLM-as-a-Judge 测试中证明了其可靠性和准确性。我们从 National Labor Exchange (NLx) Research Hub 提供的超过 1.55 亿个在线职位广告中提取了超过 100 亿个数据点,包括 O*NET 任务、职业代码、工具、技术,以及工资、技能、行业等更多特征。我们描述了由 2015-2025 年每个月活跃职位组成的职业、州和行业水平特征聚合数据集的构建。我们展示了在教育和劳动力发展中的潜在研究和未来用途。
引用
@article{arxiv.2510.01470,
title = {Extracting O*NET Features from the NLx Corpus to Build Public Use Aggregate Labor Market Data},
author = {Stephen Meisenbacher and Svetlozar Nestorov and Peter Norlander},
journal= {arXiv preprint arXiv:2510.01470},
year = {2025}
}
备注
85 pages