英文简历语料库构建及预训练语言模型测试
计算与语言
2023-02-07 v2
摘要
信息抽取(IE)一直是NLP的基本任务之一。此外,信息抽取最关键的应用场景之一是简历的信息抽取。通过对简历各部分进行分类获得结构化文本,便于存储这些文本以供后续检索和分析。进一步,所构建的简历数据也可用于AI简历筛选系统,显著减少HR的人力成本。本研究旨在将简历信息抽取任务转化为简单的句子分类任务。基于先前研究制作的英文简历数据集,改进分类规则以创建更大且更细粒度的简历分类数据集。该语料库也用于测试当前一些主流预训练语言模型(PLMs)的性能。此外,为探索训练样本数量与简历数据集正确率的关系,我们还使用不同训练集规模进行了对比实验。最终多个实验结果表明,改进标注规则并增大样本量的简历数据集提升了原始简历数据集的准确率。
引用
@article{arxiv.2208.03219,
title = {Construction of English Resume Corpus and Test with Pre-trained Language Models},
author = {Chengguang Gan and Tatsunori Mori},
journal= {arXiv preprint arXiv:2208.03219},
year = {2023}
}
备注
The Association for Natural Language Processing in Japan. Submit in NLP2023