中文

ColBERT-Zero:是否需要为ColBERT模型进行预训练

计算与语言 2026-02-19 v1 信息检索

摘要

当前最先进的多向量模型通过在强大的单向量模型之上进行小规模知识蒸馏(KD)训练获得,利用这些模型的大规模预训练。在本文中,我们研究了多向量模型的预训练问题,表明大规模多向量预训练可产生更强的多向量模型。值得注意的是,完全基于ColBERT进行预训练的模型ColBERT-Zero,仅使用公开数据即可超越GTE-ModernColBERT以及其基础模型GTE-ModernBERT(后者利用封闭且更强的数据),为该模型规模设下了新的最先进纪录。我们还发现,尽管仅进行小规模KD步骤无法获得接近完整预训练的结果,但若事先添加监督步骤,可在跳过最昂贵的无监督阶段后实现更接近的性能。最后,我们发现,将微调与预训练设置一致对于复用现有模型至关重要。为便于探索我们的实验结果,我们发布了各种检查点以及用于训练它们的代码。

关键词

引用

@article{arxiv.2602.16609,
  title  = {ColBERT-Zero: To Pre-train Or Not To Pre-train ColBERT models},
  author = {Antoine Chaffin and Luca Arnaboldi and Amélie Chatelain and Florent Krzakala},
  journal= {arXiv preprint arXiv:2602.16609},
  year   = {2026}
}

备注

9 pages, 5 tables, 2 figures