VinaLLaMA:基于 LLaMA 的越南语基础模型
计算与语言
2023-12-19 v1
摘要
在本技术报告中,我们介绍了 VinaLLaMA,这是一种面向越南语的开源权重、最先进 (SOTA) 大语言模型,构建于 LLaMA-2 之上并额外使用了 8000 亿个训练 token。VinaLLaMA 不仅展现出流利的越南语能力,还体现了对越南文化的深刻理解,使其成为真正的本土化模型。VinaLLaMA-7B-chat 在 100 万个高质量合成样本上训练,在 VLSP、VMLU 和 Vicuna Benchmark Vietnamese 等关键基准测试中取得了 SOTA 结果,标志着越南人工智能领域的重大进步,并为各种应用提供了多功能资源。
引用
@article{arxiv.2312.11011,
title = {VinaLLaMA: LLaMA-based Vietnamese Foundation Model},
author = {Quan Nguyen and Huy Pham and Dung Dao},
journal= {arXiv preprint arXiv:2312.11011},
year = {2023}
}
备注
VinaLLaMA Technical Report - 13 pages