中文

用于劳动力市场分析的高效文本编码器

计算与语言 2025-07-30 v1 人工智能

摘要

劳动力市场分析依赖于从招聘广告中提取洞察,这些广告提供了关于职位名称及相应技能要求的有价值但非结构化的信息。虽然当前最先进的技能提取方法取得了出色的性能,但它们依赖于大型语言模型(LLM),计算成本高且速度慢。在本文中,我们提出了 \textbf{ConTeXT-match},一种带有 token 级别注意力的对比学习方法,非常适合技能分类的极端多标签分类任务。\textbf{ConTeXT-match} 显著提高了技能提取的效率和性能,以轻量级双编码器模型实现了最先进的结果。为了支持稳健的评估,我们引入了 \textbf{Skill-XL},一个具有详尽的句子级技能标注的新基准,明确解决了大标签空间中的冗余问题。最后,我们提出了 \textbf{JobBERT V2},一个改进的职位名称归一化模型,利用提取的技能生成高质量的职位名称表示。实验表明,我们的模型高效、准确且可扩展,非常适合大规模、实时的劳动力市场分析。

关键词

引用

@article{arxiv.2505.24640,
  title  = {Efficient Text Encoders for Labor Market Analysis},
  author = {Jens-Joris Decorte and Jeroen Van Hautte and Chris Develder and Thomas Demeester},
  journal= {arXiv preprint arXiv:2505.24640},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication