中文

MahaParaphrase:马拉里语 paraphrase 检测语料库与基于 BERT 的模型

计算与语言 2025-08-26 v1 机器学习

摘要

Paraphrase 是帮助完成语言理解任务(如问答、风格迁移、语义解析和数据增强任务)的重要工具。由于印度语言在自然语言处理中因其丰富的形态学和句法变化、多样化的脚本以及注释数据的稀缺性而具有复杂性。本文我们提出了 L3Cube-MahaParaphrase 数据集,这是一个用于马拉里语(一种低资源印度语言)的高质量 paraphrase 语料库,包含 8,000 句句对,由人类专家标注为 Paraphrase(P)或 Non-paraphrase(NP)。我们还展示了在这些数据集上使用标准基于 Transformer 的 BERT 模型的结果。这套数据集和模型已公开分享于 https://github.com/l3cube-pune/MarathiNLP

引用

@article{arxiv.2508.17444,
  title  = {MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models},
  author = {Suramya Jadhav and Abhay Shanbhag and Amogh Thakurdesai and Ridhima Sinare and Ananya Joshi and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2508.17444},
  year   = {2025}
}