中文

NNOSE:最近邻职业技能提取

计算与语言 2024-01-31 v1

摘要

劳动力市场正在迅速变化,这促使人们对从文本中自动提取职业技能越来越感兴趣。随着英文基准职位描述数据集的出现,需要能够很好地处理其多样性的系统。我们解决了职业技能数据集任务中的复杂性——结合并利用多个数据集进行技能提取,以识别数据集中很少观察到的技能,并克服跨数据集技能稀缺的问题。特别是,我们研究了语言模型的检索增强,采用外部数据存储以数据集统一的方式检索相似技能。我们提出的方法,**N**earest **N**eighbor **O**ccupational **S**kill **E**xtraction (NNOSE),通过从数据存储中的其他数据集检索邻近技能,有效地利用了多个数据集。这在不进行额外微调的情况下提高了技能提取的性能。至关重要的是,我们观察到在预测不频繁模式方面的性能提升,在跨数据集设置中,span-F1 指标提升高达 30%。

关键词

引用

@article{arxiv.2401.17092,
  title  = {NNOSE: Nearest Neighbor Occupational Skill Extraction},
  author = {Mike Zhang and Rob van der Goot and Min-Yen Kan and Barbara Plank},
  journal= {arXiv preprint arXiv:2401.17092},
  year   = {2024}
}

备注

Accepted at EACL 2024 Main