利用大语言模型进行极端多标签技能抽取训练
计算与语言
2023-07-21 v1
摘要
在线招聘广告是技能需求信息的宝贵来源,在劳动力市场分析与电子招聘流程中起着关键作用。由于此类广告通常以自由文本形式呈现,需借助自然语言处理(NLP)技术自动处理。我们专注于检测技能(字面提及或隐含描述)并将其链接至大型技能本体这一任务,这构成了极端多标签分类(XMLC)的挑战性实例。鉴于该特定XMLC任务尚无可用的规模化标注(训练)数据集,我们提出利用通用大语言模型(LLMs)的技术。我们描述了一种经济高效的方法来生成精准的、完全合成的技能抽取标注数据集,并提出了一种在该任务中被证明有效的对比学习策略。我们在三个技能抽取基准上的结果显示,与仅通过字面匹配远程监督的已发表结果相比,R-Precision@5一致提升了15至25个百分点。
引用
@article{arxiv.2307.10778,
title = {Extreme Multi-Label Skill Extraction Training using Large Language Models},
author = {Jens-Joris Decorte and Severine Verlinden and Jeroen Van Hautte and Johannes Deleu and Chris Develder and Thomas Demeester},
journal= {arXiv preprint arXiv:2307.10778},
year = {2023}
}
备注
Accepted to the International workshop on AI for Human Resources and Public Employment Services (AI4HR&PES) as part of ECML-PKDD 2023