低资源语言技术干预的经验:增强贡迪语的信息获取
计算与语言
2022-11-30 v1 计算机与社会
摘要
开发低资源语言技术的主要障碍是缺乏具有代表性、可用的数据。在本文中,我们报告了技术驱动的数据收集方法的部署,用于创建超过 60,000 条从印地语到贡迪语的翻译语料库,贡迪语是一种低资源濒危语言,由印度中部和南部约 230 万部落人民使用。在此过程中,我们帮助从两个不同维度扩展贡迪语的信息获取:(a) 创建可供社区使用的语言资源,例如词典、儿童故事、来自多个来源的贡迪语翻译以及基于交互式语音应答(IVR)的大众宣传平台;(b) 通过开发印地语-贡迪语机器翻译模型使其在数字领域得以使用,该模型被压缩近 4 倍以使其能够在低资源边缘设备上以及几乎或无互联网连接的地区进行边缘部署。我们还展示了利用所开发的机器翻译模型为参与为目标语言收集更多数据的志愿者提供协助的初步评估。通过这些干预,我们不仅创建并评估了用于构建翻译模型的 26,240 条精炼印地语-贡迪语翻译语料库,还动员了近 850 名社区成员,他们可以帮助将贡迪语带入互联网。
引用
@article{arxiv.2211.16172,
title = {Learnings from Technological Interventions in a Low Resource Language: Enhancing Information Access in Gondi},
author = {Devansh Mehta and Harshita Diddee and Ananya Saxena and Anurag Shukla and Sebastin Santy and Ramaravind Kommiya Mothilal and Brij Mohan Lal Srivastava and Alok Sharma and Vishnu Prasad and Venkanna U and Kalika Bali},
journal= {arXiv preprint arXiv:2211.16172},
year = {2022}
}
备注
In Submission (Revised) to Language Resources and Evaluation Journal. arXiv admin note: text overlap with arXiv:2004.10270