中文

LUSIFER:基于大语言模型的语言通用空间集成以增强多语言嵌入

计算与语言 2025-05-09 v3 信息检索

摘要

基于大语言模型(LLM)的嵌入模型的最新进展为文本嵌入任务确立了新的SOTA基准,特别是在基于密集向量的检索方面。然而,这些模型主要关注英语,多语言嵌入能力在很大程度上尚未被探索。为了解决这一局限性,我们提出了LUSIFER,一种新颖的零样本方法,无需多语言监督即可将基于LLM的嵌入模型适配至多语言任务。LUSIFER的架构将一个多语言编码器(作为语言通用学习器)与一个针对嵌入特定任务优化的基于LLM的嵌入模型相结合。这些组件通过一组最少的可训练参数无缝集成,这些参数充当连接器,有效地将多语言编码器的语言理解能力迁移到专门的嵌入模型中。此外,为了全面评估多语言嵌入性能,我们引入了一个新的基准,涵盖5个主要嵌入任务、123个多样化数据集,覆盖14种语言。大量实验结果表明,LUSIFER显著提升了各种嵌入任务的多语言性能,特别是对于中等和低资源语言,且无需显式的多语言训练数据。

关键词

引用

@article{arxiv.2501.00874,
  title  = {LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models},
  author = {Hieu Man and Nghia Trung Ngo and Viet Dac Lai and Ryan A. Rossi and Franck Dernoncourt and Thien Huu Nguyen},
  journal= {arXiv preprint arXiv:2501.00874},
  year   = {2025}
}