L3Cube-MahaSTS:马拉地语句子相似度数据集与模型
计算与语言
2025-09-01 v1 机器学习
摘要
我们提出MahaSTS,一个为马拉地语人工标注的句子文本相似度(STS)数据集,以及MahaSBERT-STS-v2,一个针对回归式相似度评分优化的微调句子BERT模型。MahaSTS数据集包含16,860对马拉地语句子,标有0-5范围内的连续相似度评分。为确保监督程度均衡,该数据集在覆盖完整0-5范围的六个评分分桶中均匀分布,从而减少标签偏差并提高模型稳定性。我们对该数据集上的MahaSBERT模型进行微调,并将其性能与其他替代方法(如MahaBERT、MuRIL、IndicBERT和IndicSBERT)进行基准测试。我们的实验表明,MahaSTS能够为马拉地语的句子相似度任务有效训练,突显了人工标注注释、针对性微调和结构化监督在低资源环境中的重要作用。该数据集和模型已公开分享于https://github.com/l3cube-pune/MarathiNLP
引用
@article{arxiv.2508.21569,
title = {L3Cube-MahaSTS: A Marathi Sentence Similarity Dataset and Models},
author = {Aishwarya Mirashi and Ananya Joshi and Raviraj Joshi},
journal= {arXiv preprint arXiv:2508.21569},
year = {2025}
}