极致(小)检索器及其训练方法:mxbai-edge-colbert-v0 技术报告
信息检索
2025-10-17 v1
摘要
本文我们介绍 mxbai-edge-colbert-v0 模型,包含两个不同参数规模:17M 和 32M。在我们的研究中,我们进行了诸多实验以改进检索和晚期交互模型,这些模型意图被蒸馏到更小的模型中作为概念证明。我们的最终目标是支持所有规模的检索,从大规模云端检索到能够在任何设备上本地运行的模型。mxbai-edge-colbert-v0 是我们希望作为所有未来实验的稳固基础脊柱的模型,代表着一系列小型概念证明的第一个版本。在 mxbai-edge-colbert-v0 的开发过程中,我们进行了多项消融研究,报告了结果。在下游性能方面,mxbai-edge-colbert-v0 是一个非常有能力的小型模型,在常见短文本基准(BEIR)上超越 ColBERTv2,代表着在长上下文任务上的大幅进步,实现了前所未有的效率。
引用
@article{arxiv.2510.14880,
title = {Fantastic (small) Retrievers and How to Train Them: mxbai-edge-colbert-v0 Tech Report},
author = {Rikiya Takehi and Benjamin Clavié and Sean Lee and Aamir Shakir},
journal= {arXiv preprint arXiv:2510.14880},
year = {2025}
}