中文

基于量化 LLaMa 的模型在巴西中学考试上的基准评测

人工智能 2026-05-01 v1 计算与语言

摘要

尽管大语言模型(LLM)代表了我们与计算机交互方式的一场革命,使得构建复杂问题并能够对一系列陈述进行推理成为可能,但由于需要专用硬件来运行,其使用受到限制。在本研究中,我们评估了基于 70 亿和 130 亿参数 LLaMA 模型、经过量化处理并在家用硬件上运行的大语言模型(LLM)的性能。所考虑的模型包括 Alpaca、Koala 和 Vicuna。为评估这些模型的有效性,我们构建了一个包含 1006 道来自 ENEM(巴西国家中学考试)题目的数据库。我们的分析显示,表现最好的模型在葡萄牙语原题上的准确率约为 46%,在其英文翻译上的准确率为 49%。此外,我们通过测量执行所需时间来评估模型的计算效率。在一台配备 AMD Ryzen 5 3600x 处理器的机器上,70 亿和 130 亿参数 LLM 处理查询平均分别耗时约 20 秒和 50 秒。

关键词

引用

@article{arxiv.2309.12071,
  title  = {Benchmarking quantized LLaMa-based models on the Brazilian Secondary School Exam},
  author = {Matheus L. O. Santos and Cláudio E. C. Campelo},
  journal= {arXiv preprint arXiv:2309.12071},
  year   = {2026}
}

备注

8 pages, 6 figures, 4 tables