中文

L3Cube-MahaSBERT 与 HindSBERT:印地语和马拉地语的 Sentence BERT 模型及 BERT 句子表示基准评测

计算与语言 2022-11-23 v2 机器学习

摘要

原始 BERT 模型的句子表示在句子相似度任务上表现不佳。专门在 STS 或 NLI 数据集上训练的 Sentence-BERT 模型被证明能提供最先进的性能。然而,由于缺乏这些专用数据集,为低资源语言构建此类模型并非易事。本工作聚焦于印地语和马拉地语这两种低资源印度语言。我们使用通过机器翻译构建的合成 NLI 和 STS 数据集为这些语言训练 Sentence-BERT 模型。我们表明,先 NLI 预训练再 STSb 微调的策略可有效生成高性能的印地语和马拉地语句子相似度模型。采用这一简单策略训练的普通 BERT 模型优于使用复杂训练策略训练的多语言 LaBSE。这些模型在下游文本分类和相似度任务上进行了评估。我们在真实文本分类数据集上评估这些模型,以表明从合成数据训练获得的嵌入同样可泛化到真实数据集,从而代表一种针对低资源语言的有效训练策略。我们还基于 L3Cube-MahaBERT 和 HindBERT,对来自 fast text 模型、多语言 BERT 模型(mBERT、IndicBERT、xlm-RoBERTa、MuRIL)、多语言句子嵌入模型(LASER、LaBSE)以及单语 BERT 模型的句子嵌入进行了对比分析。我们发布了 L3Cube-MahaSBERT 和 HindSBERT,分别是马拉地语和印地语的最先进 Sentence-BERT 模型。我们的工作也可作为构建低资源句子嵌入模型的指南。

关键词

引用

@article{arxiv.2211.11187,
  title  = {L3Cube-MahaSBERT and HindSBERT: Sentence BERT Models and Benchmarking BERT Sentence Representations for Hindi and Marathi},
  author = {Ananya Joshi and Aditi Kajale and Janhavi Gadre and Samruddhi Deode and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2211.11187},
  year   = {2022}
}

备注

Accepted at Computing Conference 2023