中文

中文-技能跨度:面向 ESCO 对齐的中文职位广告中技能抽取的片段级数据集

计算与语言 2026-04-28 v1

摘要

职业技能命名实体识别(JobSkillNER)旨在自动从大规模职位招聘数据中抽取关键技能信息,这对于提高人才市场匹配效率和支持个性化就业服务至关重要。本 work 提出了面向中文招聘文本的第一个 JobSkillNER 数据集。我们针对中文职位广告提出了量身定制的标注指南和一个由大语言模型驱动的宏观-微观协作标注管道。该管道利用大语言模型(LLM)的上下文理解能力进行初始标注,然后通过专家句子级裁决进行细化。我们收集来自四大招聘平台 2014-2025 年期间的超过 20,000 个实例,并基于此发布中文-技能跨度(Chinese-SkillSpan),这是第一个面向中文 JobSkillNER 数据集,围绕 ESCO 职业技能标准,对齐并覆盖四个维度:知识、技能、横向能力和语言能力(LSKT)。实验结果表明,该数据集支持有效的模型训练和评估,表明 Chinese-SkillSpan 有助于填补中文 JobSkillNER 资源的主要缺口,并为智能招聘研究提供了有用的基准。代码和数据可在 https://sites.google.com/view/cn-skillspan-resources 获得。

关键词

引用

@article{arxiv.2604.23009,
  title  = {Chinese-SkillSpan: A Span-Level Dataset for ESCO-Aligned Competency Extraction from Chinese Job Ads},
  author = {Guojing Li and Zichuan Fu and Junyi Li and Wenxia Zhou and Xinyang Wu and Jinning Yang and Jingtong Gao and Feng Huang and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2604.23009},
  year   = {2026}
}

备注

18 pages, 10 figures, 3 tables