打破语言障碍:面向印地语与马拉地语的问答数据集
计算与语言
2024-02-20 v3
摘要
深度学习的近期进展催生了高度复杂系统的发展,这些系统对数据有着无法满足的需求。另一方面,为低资源语言构建良好的深度学习模型仍是一项具有挑战性的任务。本文聚焦于为两种此类语言——印地语与马拉地语——开发问答数据集。尽管印地语为全球第三大口语,拥有3.45亿使用者,马拉地语为全球第十一大口语,拥有8320万使用者,两种语言均面临用于构建高效问答系统的有限资源。为应对数据稀缺挑战,我们开发了一种将SQuAD 2.0数据集翻译为印地语与马拉地语的新方法。我们发布了适用于这些语言的最大问答数据集,每个数据集含28,000个样本。我们在多种架构上评估该数据集,并发布印地语与马拉地语上性能最佳的模型,以促进这些语言的进一步研究。借助相似性工具,我们的方法具备在多种语言中创建数据集的潜力,从而增进跨不同语言语境的自然语言理解。我们微调的模型、代码与数据集将公开可用。
引用
@article{arxiv.2308.09862,
title = {Breaking Language Barriers: A Question Answering Dataset for Hindi and Marathi},
author = {Maithili Sabane and Onkar Litake and Aman Chadha},
journal= {arXiv preprint arXiv:2308.09862},
year = {2024}
}