中文

LuxEmbedder:面向增强卢森堡语句子嵌入的跨语言方法

计算与语言 2024-12-06 v2 人工智能

摘要

句子嵌入模型在各种自然语言处理任务中发挥关键作用,如主题建模、文档聚类和推荐系统。然而,这些模型高度依赖平行数据,而许多低资源语言(包括卢森堡语)的平行数据稀缺。这种稀缺导致单语和跨语言句子嵌入模型在这些语言上的性能次优。为解决此问题,我们编译了一个相对较小但高质量的人工生成的跨语言平行数据集,以训练 LuxEmbedder——一个具有强大跨语言能力的卢森堡语句子嵌入模型。此外,我们进一步证明,将低资源语言纳入平行训练数据集比仅依赖高资源语言对偶更有利于其他低资源语言。进一步地,鉴于缺乏针对低资源语言的句子嵌入基准测试,我们创建了一个专为卢森堡语设计的语义句子检测基准,以此填补这一空白,并推动进一步的研究。

关键词

引用

@article{arxiv.2412.03331,
  title  = {LuxEmbedder: A Cross-Lingual Approach to Enhanced Luxembourgish Sentence Embeddings},
  author = {Fred Philippy and Siwen Guo and Jacques Klein and Tegawendé F. Bissyandé},
  journal= {arXiv preprint arXiv:2412.03331},
  year   = {2024}
}

备注

Accepted at COLING 2025