SkillSpan:从英文招聘信息中提取硬技能与软技能
计算与语言
2022-04-28 v1
摘要
技能提取(SE)是一项重要且被广泛研究的任务,有助于洞察劳动力市场动态。然而,数据集和标注指南存在空白;可用的数据集很少,且包含众包标注的片段级标签或来自预定义技能清单的标签。为解决这一差距,我们引入了 SKILLSPAN,一个新颖的 SE 数据集,包含 14.5K 个句子和超过 12.5K 个已标注片段。我们发布了由领域专家为硬技能和软技能标注、基于三个不同来源创建的相应指南。我们引入了一个 BERT 基线(Devlin 等人,2019)。为了改进此基线,我们尝试了针对长片段优化的语言模型(Joshi 等人,2020;Beltagy 等人,2020)、在招聘信息领域进行持续预训练(Han 和 Eisenstein,2019;Gururangan 等人,2020)以及多任务学习(Caruana,1997)。我们的结果表明,领域自适应模型显著优于其非自适应对应模型,且单任务学习优于多任务学习。
引用
@article{arxiv.2204.12811,
title = {SkillSpan: Hard and Soft Skill Extraction from English Job Postings},
author = {Mike Zhang and Kristian Nørgaard Jensen and Sif Dam Sonniks and Barbara Plank},
journal= {arXiv preprint arXiv:2204.12811},
year = {2022}
}
备注
Accepted to NAACL 2022 Main conference