利用多向量模型构建更优的日语单语检索器
计算与语言
2024-09-24 v2 人工智能
摘要
与英语相比,特定语言的训练数据往往稀疏可用,导致许多语言的文档检索在很大程度上依赖多语言模型。在日语中,表现最佳的基于深度学习的检索方法依赖多语言稠密嵌入器,而纯日语模型则远远落后。然而,多语言模型需要更多的计算资源和数据进行训练,具有更高的计算和内存需求,且往往缺失文化相关信息。本文介绍了 JaColBERT,这是一系列多向量检索器,其训练数据量比多语言对应模型少两个数量级,却能达到具有竞争力的性能。我们最强的模型在所有数据集上大幅超越了现有的所有日语单语检索器,并在所有域外任务上超越了最强的现有多语言模型,凸显了对能够处理语言特异性的专用模型的需求。这些成果是通过一个仅含 1.1 亿参数的模型实现的,该模型远小于所有多语言模型,且仅使用了有限的日语语料。我们相信,我们的结果展示了在广泛领域支持日语检索增强型应用管道的巨大潜力。
引用
@article{arxiv.2312.16144,
title = {Towards Better Monolingual Japanese Retrievers with Multi-Vector Models},
author = {Benjamin Clavié},
journal= {arXiv preprint arXiv:2312.16144},
year = {2024}
}