用于多标签技能提取的对比双编码器模型:利用 BERT 与注意力机制增强 ESCO 本体匹配
计算与语言
2026-01-15 v1 综合经济学
经济学
摘要
细粒度的劳动力市场分析日益依赖于将非结构化的招聘广告映射到标准化技能分类体系(如 ESCO)。这种映射自然地被表述为极端多标签分类(XMLC)问题,但有监督的解决方案受到大规模、与分类体系对齐的标注数据稀缺和高成本的制约——尤其是在招聘广告语言与正式技能定义存在显著差异的非英语环境中。我们提出了一种零样本技能提取框架,无需人工标注的招聘广告训练数据。该框架使用大型语言模型(LLM)从 ESCO 定义中合成训练实例,并引入基于 ESCO 二级类别的分层约束多技能生成,以提高多标签语境下的语义连贯性。在合成语料库的基础上,我们训练了一个对比双编码器,在共享嵌入空间中对齐招聘广告句子与 ESCO 技能描述;该编码器在 BERT 主干网络的基础上增加了 BiLSTM 和注意力池化,以更好地建模长且信息密集的需求描述。上游的基于 RoBERTa 的二元过滤器移除非技能句子,以提高端到端精度。实验表明:(i)与无约束配对相比,层次条件生成提高了流畅性和可区分性;(ii)所得的多标签模型有效迁移至真实世界的中文招聘广告,实现了强大的零样本检索性能(F1@5 = 0.72),优于 TF-IDF 和标准 BERT 基线。总体而言,所提出的流程为劳动经济学和劳动力分析中的自动化技能编码提供了一条可扩展、数据高效的路径。
引用
@article{arxiv.2601.09119,
title = {Contrastive Bi-Encoder Models for Multi-Label Skill Extraction: Enhancing ESCO Ontology Matching with BERT and Attention Mechanisms},
author = {Yongming Sun},
journal= {arXiv preprint arXiv:2601.09119},
year = {2026}
}