超越专业化:评估大语言模型在印度语言转写中的能力
计算与语言
2025-05-27 v1 人工智能
摘要
转写是将文本从一种脚本映射到另一种脚本的过程,在多语言自然语言处理中发挥着关键作用,尤其是在印度这样的语言多样化语境中。尽管通过诸如 IndicXlit 等专业模型取得了显著进展,但最近的大型语言模型(LLM)的发展表明,通用模型可能在无需显式任务特定训练的情况下在此任务中取得优异性能。本文系统评估了包括 GPT-4o、GPT-4.5、GPT-4.1、Gemma-3-27B-it 和 Mistral-Large 在内的主要大型语言模型,针对印度十大主要语言,对比 IndicXlit——一条最先进的转写模型。实验采用标准基准,包括 Dakshina 和 Aksharantar 数据集,通过 Top-1 准确率和字符错误率评估性能。我们的发现表明,尽管 GPT 系列模型在大多数情况下均优于其他大型语言模型和 IndicXlit,但对特定语言进行微调后性能亦有显著提升。进一步的错误分析和在噪声条件下的鲁棒性测试进一步阐明了大型语言模型相较于专业模型的优势,凸显了基础模型在广泛的专业应用中具有更高效益的潜力。
引用
@article{arxiv.2505.19851,
title = {Beyond Specialization: Benchmarking LLMs for Transliteration of Indian Languages},
author = {Gulfarogh Azam and Mohd Sadique and Saif Ali and Mohammad Nadeem and Erik Cambria and Shahab Saquib Sohail and Mohammad Sultan Alam},
journal= {arXiv preprint arXiv:2505.19851},
year = {2025}
}