中文

IPOD:一个工业与职业数据集及其在职业数据挖掘与分析中的应用

计算与语言 2020-04-28 v2 信息检索 机器学习

摘要

职业数据挖掘与分析是理解当今产业与就业市场的重要任务。各类机器学习技术被提出并逐步部署,以改进公司的上游任务运营,如员工流失预测、职业轨迹建模与自动面试。作为基础构建模块,职位名称分析与嵌入是解决这些职业数据挖掘与分析问题的关键上游任务。本工作中,我们提出工业与职业数据集(IPOD),其包含从Linkedin上超过56,000份档案爬取的超过190,000个职位名称。我们还通过解决两个具有挑战性的上游任务来展示IPOD的用处,包括:(i)提出Title2vec,一种使用双向语言模型(biLM)方法的上下文职位名称向量表示;以及(ii)使用条件随机场(CRF)和带CRF的双向长短期记忆(LSTM-CRF)解决重要的职业命名实体识别问题。CRF与LSTM-CRF在精确匹配准确率与F1分数上均优于人类与基线。数据集与预训练嵌入可在 https://www.github.com/junhua/ipod 获取。

关键词

引用

@article{arxiv.1910.10495,
  title  = {IPOD: An Industrial and Professional Occupations Dataset and its Applications to Occupational Data Mining and Analysis},
  author = {Junhua Liu and Yung Chuen Ng and Kristin L. Wood and Kwan Hui Lim},
  journal= {arXiv preprint arXiv:1910.10495},
  year   = {2020}
}