ESCOXLM-R:面向就业市场领域的多语言分类体系驱动预训练
计算与语言
2023-05-23 v1
摘要
计算就业市场领域中自然语言处理(NLP)任务基准数量的不断增加,凸显了对能够处理技能抽取、技能分类、职位名称分类和去标识化等就业相关任务的方法的需求。虽然已开发出一些针对就业市场领域的方法,但缺乏用于这些任务的通用多语言模型和基准。在本研究中,我们引入了一个基于 XLM-R 的语言模型 ESCOXLM-R,该模型使用欧洲技能、能力、资格和职业(ESCO)分类体系(涵盖 27 种语言)进行领域自适应预训练。ESCOXLM-R 的预训练目标包括动态掩码语言建模,以及一种用于诱导多语言分类体系 ESCO 关系的新型附加目标。我们在 4 种语言的 6 个序列标注任务和 3 个分类任务上全面评估了 ESCOXLM-R 的性能,发现其在 9 个数据集中的 6 个上取得了最先进的结果。我们的分析表明,ESCOXLM-R 在短跨度上表现更好,并在实体级和表面级 span-F1 上优于 XLM-R,这可能是由于 ESCO 包含简短的技能和职业名称,并编码了实体级信息。
引用
@article{arxiv.2305.12092,
title = {ESCOXLM-R: Multilingual Taxonomy-driven Pre-training for the Job Market Domain},
author = {Mike Zhang and Rob van der Goot and Barbara Plank},
journal= {arXiv preprint arXiv:2305.12092},
year = {2023}
}
备注
Accepted at ACL2023 (Main)