zELO:受 ELO 启发的重排序器与嵌入模型训练方法
人工智能
2025-09-17 v1
摘要
我们引入了一种名为 zELO 的新型训练方法,该方法通过分析排序任务在静态上等价于 Thurstone 模型来优化检索性能。基于 zELO 方法,我们使用无监督数据训练了一系列 state-of-the-art 的开放权重重排序器模型:zerank-1 和 zerank-1-small。这些模型在包括金融、法律、代码和 STEM 在内的多个领域中取得了最高的检索得分,在 NDCG@10 和 Recall 上均优于闭源专有重排序器。这些模型还展现出极强的通用性,在域外和私有客户数据集上保持了其 0-shot 性能。训练数据包含 112,000 个查询,每个查询对应 100 个文档,并在不到 10,000 个 H100 小时内从无标注查询和文档中端到端完成训练。
引用
@article{arxiv.2509.12541,
title = {zELO: ELO-inspired Training Method for Rerankers and Embedding Models},
author = {Nicholas Pipitone and Ghita Houir Alami and Advaith Avadhanam and Anton Kaminskyi and Ashley Khoo},
journal= {arXiv preprint arXiv:2509.12541},
year = {2025}
}
备注
13 pages, 9 sections, 17 figures and tables