面向低资源马耳他自然语言处理的大语言模型基准测试:MELABenchv1
计算与语言
2025-08-15 v2 人工智能
摘要
大型语言模型(LLMs)在 various Natural Language Processing(NLP)任务中展现出惊人的性能,主要归因于其泛化能力和无需额外训练即可完成任务的特点。然而,这些模型在低资源语言上的有效性仍受限。本研究评估了55个公开可用的 LLMs 在马耳他语(一种低资源语言)上的表现,使用新构建的覆盖11个判别性和生成性任务的基准测试。我们的实验表明,许多模型在特定任务上表现不佳,尤其是生成任务,而且较小的微调模型在所有任务中往往表现更好。通过多维度分析,我们检讨了影响性能的各类因素。我们得出结论,马耳他语在预训练和指令微调期间的先发 exposure 是最重要的影响因素。我们还检讨了微调与提示(prompting)之间的权衡,指出虽然微调初始成本较高,但其产出更好的性能和更低的推理成本。通过本工作,我们旨在凸显包容性语言技术的必要性,并建议在低资源语言研究中考虑更“传统”的语言建模方法。
引用
@article{arxiv.2506.04385,
title = {MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLP},
author = {Kurt Micallef and Claudia Borg},
journal= {arXiv preprint arXiv:2506.04385},
year = {2025}
}
备注
mT5 XXL & EuroLLM Instruct 9B 1-shot results