中文

JCTC:用于文本分类的大型招聘公告语料库

信息检索 2017-06-13 v2

摘要

缺乏合适的文本分类语料库使得海量在线招聘信息无法用于劳动力市场分析。本文提出 JCTC,一个用于文本分类的大型招聘公告语料库。在 JCTC 构建框架中,选用中国中央政府发布的正式规范作为分类标准。无监督学习(WE-cos)、监督学习算法(SVM)和人工判断都用于构建过程。JCTC 有 102581 个在线招聘公告,分布在 465 个类别。提出的方法不仅能改善对人员技能和知识的较高要求,还能减少主观影响。此外,该方法不限于中文。我们在 JCTC 上基准测试了五种最先进的深度学习方法,为未来研究提供基线结果。JCTC 可能是第一个用于文本分类的招聘公告语料库,也是最大的中文语料库。借助 JCTC,相关组织能够全面、准确、及时地监测、分析和预测劳动力市场。

关键词

引用

@article{arxiv.1705.06123,
  title  = {JCTC: A Large Job posting Corpus for Text Classification},
  author = {Haoyu Xu and Chongyang Gu and Han Zhou and Sengpan Kou and Junjie Zhang},
  journal= {arXiv preprint arXiv:1705.06123},
  year   = {2017}
}

备注

15 pages, 3 figures