RankPO:基于偏好优化的职位-人才匹配
计算与语言
2025-03-17 v1 人工智能
信息检索
机器学习
摘要
将职位描述(JD)与合适的人才匹配需要模型能够理解不仅仅是JD和候选人简历之间的文本相似性,还要理解地理位置和学术资历等情境因素。为此,我们提出了一种针对大型语言模型(LLM)的两阶段训练框架。在第一阶段,我们使用对比学习方法,在由真实世界匹配规则构建的数据集上训练模型,如地理对齐和研究领域重叠。虽然有效,但该模型主要学习由匹配规则定义的模式。在第二阶段,我们引入一种受直接偏好优化(DPO)启发的新颖偏好基优选方法,称为Rank Preference Optimization(RankPO),以与AI精选的成对偏好一致。我们的实验表明,第一阶段模型在基于规则的数据上(nDCG@20 = 0.706)取得了强烈的性能,但在文本理解方面有限(与AI注释对齐 = 0.46)。通过使用RankPO微调,我们获得了一个在原有任务中保持相当好性能,同时显著提高与AI偏好对齐的平衡模型。代码和数据可在 https://github.com/yflyzhang/RankPO 获取。
引用
@article{arxiv.2503.10723,
title = {RankPO: Preference Optimization for Job-Talent Matching},
author = {Yafei Zhang and Murray Wang and Yu Wang and Xiaohui Wang},
journal= {arXiv preprint arXiv:2503.10723},
year = {2025}
}
备注
15 pages, 3 figures, 7 tables