Konkani LLM:面向低资源印度语言的多脚本指令调优与评估
计算与语言
2026-03-26 v1 人工智能
摘要
大型语言模型(LLMs)在诸如 Konkani 等低资源语言环境中持续表现不佳。这一绩效差距源于严重的训练数据稀缺,以及 Devanagari、Romi 和 Kannada 三种文字体系中的高脚本多样性。为此,我们引入了 Konkani-Instruct-100k,通过 Gemini 3 生成的综合 synthetic instruction-tuning 数据集。我们通过评估领先的 open-weights architectures 包括 Llama 3.1、Qwen2.5 和 Gemma 3,以及 proprietary closed-source models,建立了严格的 baseline 基准。我们的主要贡献是开发 Konkani LLM 系列针对地区细微差异进行优化的 fine-tuned 模型。此外,我们正在开发 Multi-Script Konkani Benchmark 以促进跨脚本语言评估。在机器翻译任务中,Konkani LLM 相较于 corresponding base models 稳定获得性能提升,并在多个设置下与 proprietary baseline 相竞争甚至超越。
关键词
引用
@article{arxiv.2603.23529,
title = {Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language},
author = {Reuben Chagas Fernandes and Gaurang S. Patkar},
journal= {arXiv preprint arXiv:2603.23529},
year = {2026}
}