Mira-Embeddings-V1: 通过 LLM 合成数据实现招聘领域语义重排序
计算与语言
2026-04-21 v1
摘要
招聘人员的候选人筛选最好作为检索和重排序的两阶段流程,在有限的审阅预算下以召回率作为主要目标。上游生产检索器首先为每个职位描述(JD)返回一组候选人短列表,而我们的目标是对该短列表进行重排序,使合格候选人尽可能靠前。我们提出了 mira-embeddings-v1,这是一种用于招聘领域的语义重排序系统,通过 LLM 合成的训练数据重塑嵌入空间,并通过轻量级重排序头纠正边界混淆。我们从真实的 JD 开始,构建一个五阶段的提示流程来生成多样化的正样本和硬负样本,从多个角度塑造语义空间。随后,我们应用两轮 LoRA 适配:先进行 JD-JD 对比学习,再进行 JD-CV 三元组对齐,在异构文本数据集上进行训练。重要的是,这些收益不需要大规模的人工标注的工业训练对:一小套真实的 JD 被扩展为通过 LLM 合成的监督信号。最后,一个 BoundaryHead MLP 对 Top-K 结果进行重排序,以区分共享相同标题但范围不同的角色。在本地 300 个真实 JD 的候选人池中,使用来自上游生产检索器的候选人,mira-embeddings-v1 将 Recall@50 从 68.89% 提升至 77.55%,并将 Precision@10 从 35.77% 提升至 39.62%。在支持全局的 44,138 个候选人池中,由 Qwen3-32B 评判标准判断,mira-embeddings-v1 在 Recall@200 上达到 0.7047,远超基线的 0.5969。这些结果表明,LLM 合成的监督信号与边界感知的重排序能够在不依赖大型交叉编码器的情况下实现稳健的提升。
引用
@article{arxiv.2604.17738,
title = {Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data},
author = {Zhaohua Liang and Zhilin Wang and Renjie Cao and Yining Zhang},
journal= {arXiv preprint arXiv:2604.17738},
year = {2026}
}