面向高效简历理解:一种多粒度多模态预训练方法
计算与语言
2024-04-23 v1 人工智能
机器学习
摘要
在广泛采用在线招聘的当代,简历理解被广泛认为是一项基础且关键的任务,旨在从简历文档中自动提取结构化信息。与传统的基于规则的方法相比,利用最近提出的预训练文档理解模型可以极大提高简历理解的有效性。然而,现有的方法忽略了简历中结构化信息内部的层次关系,并且难以高效地解析简历。为此,本文提出了一种名为 ERU 的新模型,以实现高效的简历理解。具体而言,我们首先引入了一个具有版面感知的多模态融合 Transformer,用于编码简历中的片段,并整合文本、视觉和版面信息。然后,我们设计了三个自监督任务,通过大量无标签简历对该模块进行预训练。接下来,我们使用多粒度序列标注任务对模型进行微调,以从简历中提取结构化信息。最后,在真实世界数据集上的大量实验清楚地证明了 ERU 的有效性。
引用
@article{arxiv.2404.13067,
title = {Towards Efficient Resume Understanding: A Multi-Granularity Multi-Modal Pre-Training Approach},
author = {Feihu Jiang and Chuan Qin and Jingshuai Zhang and Kaichun Yao and Xi Chen and Dazhong Shen and Chen Zhu and Hengshu Zhu and Hui Xiong},
journal= {arXiv preprint arXiv:2404.13067},
year = {2024}
}
备注
ICME 2024 Accepted