GrEmLIn:注入多语言图知识的 87 种低资源语言绿色基线嵌入库
计算与语言
2025-01-28 v3
摘要
基于大型语言模型 (LLM) 的上下文嵌入可用于多种语言,但对于资源较少的语言,其覆盖范围往往有限。对于此类语言,使用 LLM 通常因高昂的计算成本而困难重重,这不仅体现在训练阶段,也体现在推理阶段。静态词嵌入的资源效率要高得多(“绿色”),因此仍然具有价值,特别是对于资源极少的语言。然而,目前明显缺乏包含此类嵌入的综合性库。为弥补这一空白,我们提出了 GrEmLIn,一个集中式的绿色静态基线嵌入库,涵盖 87 种中低资源语言。我们采用一种新方法计算 GrEmLIn 嵌入,该方法通过整合多语言图知识来增强 GloVe 嵌入,这使得我们的静态嵌入在推理时无需参数即可与 LLM 嵌入相媲美。实验表明,GrEmLIn 嵌入在词汇相似性任务上优于最先进的上下文嵌入 (E5)。在情感分析和自然语言推理等外部评估任务中,只要与目标任务有足够的词汇重叠,其性能与最先进模型相当,平均性能差距仅为 5-10% 或更小,仅在主题分类任务上表现不佳。我们的代码和嵌入可在 https://huggingface.co/DFKI 公开获取。
关键词
引用
@article{arxiv.2409.18193,
title = {GrEmLIn: A Repository of Green Baseline Embeddings for 87 Low-Resource Languages Injected with Multilingual Graph Knowledge},
author = {Daniil Gurgurov and Rishu Kumar and Simon Ostermann},
journal= {arXiv preprint arXiv:2409.18193},
year = {2025}
}
备注
Long paper, accepted to NAACL 2025 Findings