中文

多语言Sentence-T5:面向多语言应用的可扩展句子编码器

计算与语言 2024-03-27 v1

摘要

先前关于多语言句子嵌入的工作已证明,有效利用自然语言推理(NLI)数据构建高性能模型可以超越传统方法。然而,近期参数规模达数十亿的语言模型“指数级”增长所带来的潜在益处尚未被充分探索。本文通过扩展现有的单语模型Sentence T5,引入了多语言Sentence T5(m-ST5),作为一个基于NLI的更大规模多语言句子嵌入模型。通过采用低秩适应(LoRA)技术,我们成功将模型规模扩展至57亿参数。我们进行了实验评估句子嵌入的性能,并验证了该方法优于基于NLI的先前方法。此外,我们还证实了模型规模与其性能之间存在正相关。特别值得注意的是,资源较少的语言或与英语语言相似度较低的语言从参数增加中获益更多。我们的模型可在 https://huggingface.co/pkshatech/m-ST5 获取。

关键词

引用

@article{arxiv.2403.17528,
  title  = {Multilingual Sentence-T5: Scalable Sentence Encoders for Multilingual Applications},
  author = {Chihiro Yano and Akihiko Fukuchi and Shoko Fukasawa and Hideyuki Tachibana and Yotaro Watanabe},
  journal= {arXiv preprint arXiv:2403.17528},
  year   = {2024}
}

备注

Accepted in LREC-COLING 2024