LUSIFER:基于大语言模型的语言通用空间集成以增强多语言嵌入
计算与语言
2025-05-09 v3 信息检索
摘要
基于大语言模型(LLM)的嵌入模型的最新进展为文本嵌入任务确立了新的SOTA基准,特别是在基于密集向量的检索方面。然而,这些模型主要关注英语,多语言嵌入能力在很大程度上尚未被探索。为了解决这一局限性,我们提出了LUSIFER,一种新颖的零样本方法,无需多语言监督即可将基于LLM的嵌入模型适配至多语言任务。LUSIFER的架构将一个多语言编码器(作为语言通用学习器)与一个针对嵌入特定任务优化的基于LLM的嵌入模型相结合。这些组件通过一组最少的可训练参数无缝集成,这些参数充当连接器,有效地将多语言编码器的语言理解能力迁移到专门的嵌入模型中。此外,为了全面评估多语言嵌入性能,我们引入了一个新的基准,涵盖5个主要嵌入任务、123个多样化数据集,覆盖14种语言。大量实验结果表明,LUSIFER显著提升了各种嵌入任务的多语言性能,特别是对于中等和低资源语言,且无需显式的多语言训练数据。
引用
@article{arxiv.2501.00874,
title = {LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models},
author = {Hieu Man and Nghia Trung Ngo and Viet Dac Lai and Ryan A. Rossi and Franck Dernoncourt and Thien Huu Nguyen},
journal= {arXiv preprint arXiv:2501.00874},
year = {2025}
}