Bhasha-Abhijnaanam:面向 22 种印度语言的母语文字与罗马化语言识别
计算与语言
2023-10-27 v3
摘要
我们创建了公开可用的语言识别(LID)数据集与模型,涵盖印度宪法所列全部 22 种印度语言,包含母语文字与罗马化文本。首先,我们构建了 Bhasha-Abhijnaanam,一个覆盖全部 22 种印度语言的母语文字及罗马化文本的语言识别测试集。我们还训练了 IndicLID,一种针对上述所有语言的母语文字与罗马化文字的语言识别器。对于母语文字文本,它比现有 LID 具有更好的语言覆盖度,且与其它 LID 相比具有竞争力或更优。IndicLID 是首个面向印度语言罗马化文本的语言识别器。罗马化文本 LID 的两个主要挑战是缺乏训练数据以及语言相似时 LID 性能低下。我们为这些问题提供了简单有效的解决方案。总体而言,任何语言的罗马化文本研究都较为有限,我们的发现也适用于其他需要罗马化语言识别的语言。我们的模型以开源许可发布于 https://ai4bharat.iitm.ac.in/indiclid,训练集与测试集同样以开源许可发布于 https://ai4bharat.iitm.ac.in/bhasha-abhijnaanam。
引用
@article{arxiv.2305.15814,
title = {Bhasha-Abhijnaanam: Native-script and romanized Language Identification for 22 Indic languages},
author = {Yash Madhani and Mitesh M. Khapra and Anoop Kunchukuttan},
journal= {arXiv preprint arXiv:2305.15814},
year = {2023}
}
备注
Accepted to ACL 2023