中文

构建数据驱动的职业分类体系:一种基于语义聚类与多智能体协作的自底向上多阶段方法

人工智能 2025-09-22 v1 信息检索

摘要

构建稳健的职业分类体系对于从职位推荐到劳动力市场情报等应用至关重要,但这一任务极具挑战性。人工构建速度缓慢,而现有的自动化方法要么无法适应动态的区域市场(自顶向下),要么难以从嘈杂数据中构建连贯的层次结构(自底向上)。我们引入了 CLIMB(基于聚类的多智能体分类构建器,CLusterIng-based Multi-agent taxonomy Builder),这是一个能够从原始招聘信息中完全自动化创建高质量、数据驱动分类体系的框架。CLIMB 使用全局语义聚类来提取核心职业,随后采用基于反思的多智能体系统迭代构建连贯的层次结构。在三个多样化的真实世界数据集上,我们表明 CLIMB 生成的分类体系比现有方法更连贯、更具可扩展性,并成功捕捉了独特的区域特征。我们在 https://anonymous.4open.science/r/CLIMB 发布了代码和数据集。

关键词

引用

@article{arxiv.2509.15786,
  title  = {Building Data-Driven Occupation Taxonomies: A Bottom-Up Multi-Stage Approach via Semantic Clustering and Multi-Agent Collaboration},
  author = {Nan Li and Bo Kang and Tijl De Bie},
  journal= {arXiv preprint arXiv:2509.15786},
  year   = {2025}
}