中文

RankPO:基于偏好优化的职位-人才匹配

计算与语言 2025-03-17 v1 人工智能 信息检索 机器学习

摘要

将职位描述(JD)与合适的人才匹配需要模型能够理解不仅仅是JD和候选人简历之间的文本相似性,还要理解地理位置和学术资历等情境因素。为此,我们提出了一种针对大型语言模型(LLM)的两阶段训练框架。在第一阶段,我们使用对比学习方法,在由真实世界匹配规则构建的数据集上训练模型,如地理对齐和研究领域重叠。虽然有效,但该模型主要学习由匹配规则定义的模式。在第二阶段,我们引入一种受直接偏好优化(DPO)启发的新颖偏好基优选方法,称为Rank Preference Optimization(RankPO),以与AI精选的成对偏好一致。我们的实验表明,第一阶段模型在基于规则的数据上(nDCG@20 = 0.706)取得了强烈的性能,但在文本理解方面有限(与AI注释对齐 = 0.46)。通过使用RankPO微调,我们获得了一个在原有任务中保持相当好性能,同时显著提高与AI偏好对齐的平衡模型。代码和数据可在 https://github.com/yflyzhang/RankPO 获取。

关键词

引用

@article{arxiv.2503.10723,
  title  = {RankPO: Preference Optimization for Job-Talent Matching},
  author = {Yafei Zhang and Murray Wang and Yu Wang and Xiaohui Wang},
  journal= {arXiv preprint arXiv:2503.10723},
  year   = {2025}
}

备注

15 pages, 3 figures, 7 tables