NNOSE:最近邻职业技能提取
计算与语言
2024-01-31 v1
摘要
劳动力市场正在迅速变化,这促使人们对从文本中自动提取职业技能越来越感兴趣。随着英文基准职位描述数据集的出现,需要能够很好地处理其多样性的系统。我们解决了职业技能数据集任务中的复杂性——结合并利用多个数据集进行技能提取,以识别数据集中很少观察到的技能,并克服跨数据集技能稀缺的问题。特别是,我们研究了语言模型的检索增强,采用外部数据存储以数据集统一的方式检索相似技能。我们提出的方法,**N**earest **N**eighbor **O**ccupational **S**kill **E**xtraction (NNOSE),通过从数据存储中的其他数据集检索邻近技能,有效地利用了多个数据集。这在不进行额外微调的情况下提高了技能提取的性能。至关重要的是,我们观察到在预测不频繁模式方面的性能提升,在跨数据集设置中,span-F1 指标提升高达 30%。
引用
@article{arxiv.2401.17092,
title = {NNOSE: Nearest Neighbor Occupational Skill Extraction},
author = {Mike Zhang and Rob van der Goot and Min-Yen Kan and Barbara Plank},
journal= {arXiv preprint arXiv:2401.17092},
year = {2024}
}
备注
Accepted at EACL 2024 Main