TurkColBERT:面向土耳其信息检索的稠密与晚交互模型基准
计算与语言
2025-11-21 v1 人工智能
信息检索
摘要
神经信息检索系统在高资源语言中表现优异,但对于形态丰富、资源较少的土耳其语等低资源语言仍鲜有探索。稠密双编码器目前主导土耳其语信息检索,而晚交互模型——保留词级表示以实现细粒度匹配——尚未得到系统评估。我们引入TurkColBERT,首个综合性基准,比较稠密编码器与晚交互模型在土耳其语检索中的表现。我们的两阶段适应流程首先在土耳其NLI/STS任务上微调英语和多语言编码器,然后转换为基于ColBERT的检索器,使用PyLate在MS MARCO-TR上训练。我们在覆盖科学、金融和论证等领域的五个土耳其BEIR数据集上评估10个模型。结果表明,参数效率极高:110万参数的colbert-hash-nano-tr模型比6亿参数的土耳其e5-large稠密编码器小600倍,同时保留了其平均mAP的71%以上。规模为稠密编码器3至5倍的晚交互模型显著优于稠密编码器;ColmmBERT-base-TR在特定领域任务上可实现最高+13.8%的mAP提升。对于生产就绪性,我们比较了索引算法:MUVERA+Rerank比PLAID快3.33倍,同时提供+1.7%的相对mAP提升。这实现了低延迟检索,ColmmBERT-base-TR使用MUVERA可实现0.54毫秒的查询时间。我们发布所有检查点、配置和评估脚本。局限性包括依赖中等规模数据集(≤5万文档)和翻译基准,可能无法完全反映土耳其语实际检索条件;更大规模的MUVERA评估仍有必要。
引用
@article{arxiv.2511.16528,
title = {TurkColBERT: A Benchmark of Dense and Late-Interaction Models for Turkish Information Retrieval},
author = {Özay Ezerceli and Mahmoud El Hussieni and Selva Taş and Reyhan Bayraktar and Fatma Betül Terzioğlu and Yusuf Çelebi and Yağız Asker},
journal= {arXiv preprint arXiv:2511.16528},
year = {2025}
}