JaColBERTv2.5:在资源受限条件下优化多向量检索器以构建最先进的日语检索器
信息检索
2024-07-31 v1 人工智能
计算与语言
摘要
神经信息检索在高资源语言中进展迅速,但在日语等低资源语言中,由于数据稀缺等问题,进展受到阻碍。因此,多语言模型一直主导着日语检索,尽管其计算效率低下且无法捕捉语言细微差别。虽然像JaColBERT这样的近期单语多向量模型缩小了这一差距,但在大规模评估中仍落后于多语言方法。本研究聚焦于日语,针对低资源环境下多向量检索器的次优训练方法。我们系统地评估并改进了JaColBERT以及更广泛的多向量模型在推理和训练设置中的关键方面。我们通过一种新颖的检查点合并步骤进一步提升了性能,证明这是结合微调优势与原始检查点泛化能力的有效方法。基于我们的分析,我们提出了一种新颖的训练方案,由此产生了JaColBERTv2.5模型。JaColBERTv2.5仅拥有1.1亿参数,并在4块A100 GPU上训练不到15小时,在所有现有基准测试中均显著优于现有方法,平均得分达到0.754,明显超过此前最佳的0.720。为支持未来研究,我们公开了最终模型、中间检查点以及所有使用的数据。
关键词
引用
@article{arxiv.2407.20750,
title = {JaColBERTv2.5: Optimising Multi-Vector Retrievers to Create State-of-the-Art Japanese Retrievers with Constrained Resources},
author = {Benjamin Clavié},
journal= {arXiv preprint arXiv:2407.20750},
year = {2024}
}