探索最新大型语言模型在越南语机器阅读理解中的表现
计算与语言
2025-03-25 v1
摘要
大型语言模型 (LLM) 在机器阅读理解 (MRC) 任务中展现出惊人的能力;然而,其对于资源有限的语言如越南语的效果尚未得到广泛探索。本文对两款最新 SOTA LLM:Llama 3 (80 亿参数) 和 Gemma (70 亿参数) 在越南语 MRC 数据集 ViMMRC 上的微调和评估进行了研究。通过利用量化低秩适配 (QLoRA),我们高效地微调了这些模型,并将其性能与强大的基于 LLM 的基线方法进行了比较。尽管我们的微调模型规模小于 GPT-3 和 GPT-3.5,但它们超越了传统的 BERT-based 方法以及这些更大模型。这表明了我们的微调过程的有效性,展示了现代 LLM 如何超越像 BERT 这样的旧模型,同时仍适合在资源受限的环境中部署。在深入的分析中,我们探讨了模型性能的 various aspects,为适应低资源语言如越南语的 LLM 提供了宝贵的见解。我们的研究推动了自然语言处理在低资源语言领域的发展,我们将微调后的模型公开发布在:https://huggingface.co/iaiuet。
引用
@article{arxiv.2503.18062,
title = {Investigating Recent Large Language Models for Vietnamese Machine Reading Comprehension},
author = {Anh Duc Nguyen and Hieu Minh Phi and Anh Viet Ngo and Long Hai Trieu and Thai Phuong Nguyen},
journal= {arXiv preprint arXiv:2503.18062},
year = {2025}
}