中文

L3Cube-IndicSBERT:一种利用多语言 BERT 学习跨语言句子表示的简单方法

计算与语言 2023-04-25 v1 机器学习

摘要

多语言 Sentence-BERT (SBERT) 模型将不同语言映射到共同的表示空间,对跨语言相似度与挖掘任务十分有用。我们提出了一种简单而有效的方法,利用合成语料将原始的 vanilla 多语言 BERT 模型转换为多语言句子 BERT 模型。我们只需将低资源目标语言的翻译版 NLI 或 STS 数据集聚合在一起,并对原始多语言 BERT 模型执行类 SBERT 的微调。我们表明,多语言 BERT 模型本身就是跨语言学习器,这种无需显式跨语言训练的朴素基线微调方法即可产生卓越的跨语言特性。我们在 10 种主要印度语言上展示了方法的有效性,并展示了该方法对非印度语言德语和法语的适用性。利用该方法,我们进一步提出了 L3Cube-IndicSBERT,这是首个专门针对印度语言 Hindi、Marathi、Kannada、Telugu、Malayalam、Tamil、Gujarati、Odia、Bengali 和 Punjabi 的多语言句子表示模型。IndicSBERT 展现出强大的跨语言能力,在印度语言跨语言与单语句子相似度任务上的表现显著优于 LaBSE、LASER 和 paraphrase-multilingual-mpnet-base-v2 等替代方案。我们还发布了每种语言的单语 SBERT 模型,并表明 IndicSBERT 与其单语对应模型相比具有竞争力。这些模型已使用嵌入相似度分数和分类准确率进行了评估。

关键词

引用

@article{arxiv.2304.11434,
  title  = {L3Cube-IndicSBERT: A simple approach for learning cross-lingual sentence representations using multilingual BERT},
  author = {Samruddhi Deode and Janhavi Gadre and Aditi Kajale and Ananya Joshi and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2304.11434},
  year   = {2023}
}