罗马化印地语和孟加拉语建模:数据集创建与多语言大语言模型集成
计算与语言
2025-12-01 v1
摘要
发展健壮的转写技术对于增强将罗马化脚本转化为本土脚本的效果至关重要,这对于自然语言处理任务(包括情感分析、语音识别、信息检索和智能个人助理)都是至关重要的。尽管取得了显著进展,但当前最先进的多语言模型仍面临在罗马化脚本上处理挑战,即采用罗马字母表示多样化语言的语音结构。在南亚语境下,罗马化脚本用于印度-Aryan语言在社交媒体和数字通信平台上广泛使用,这种用法持续为前沿多语言模型带来重大挑战。尽管有限数量的转写数据集和模型可用于印度-A罗语言,但它们通常缺乏在发音和拼写变体方面的足够多样性、用于大型语言模型(LLM)训练的足够的代码混合数据,以及低资源适应性。为此,我们引入了一个用于两种流行印度-A罗语言(印地语和孟加拉语)的新型转写数据集,这两种语言分别位于全球第3和第7位最常用语言。我们的数据集包含近180万组印地语和100万组孟加拉语转写对。此外,我们基于开发的数据集对基于Marian架构的自定义多语言序列到序列大语言模型进行预训练。实验结果表明,与现有相关模型相比,在BLEU和CER指标上均实现了显著改进。
引用
@article{arxiv.2511.22769,
title = {Modeling Romanized Hindi and Bengali: Dataset Creation and Multilingual LLM Integration},
author = {Kanchon Gharami and Quazi Sarwar Muhtaseem and Deepti Gupta and Lavanya Elluri and Shafika Showkat Moni},
journal= {arXiv preprint arXiv:2511.22769},
year = {2025}
}
备注
Proceedings of the 8th Workshop on Big Data for Cybersecurity (BigCyber)