Open Ko-LLM 排行榜:使用 Ko-H5 基准评估韩语大语言模型
计算与语言
2024-08-20 v2 人工智能
摘要
本文介绍了 Open Ko-LLM 排行榜和 Ko-H5 基准测试,作为评估韩语大语言模型(LLM)的重要工具。在镜像英语 Open LLM 排行榜的同时引入私有测试集,我们建立了一个稳健的评估框架,该框架已在韩语 LLM 社区中良好整合。我们进行了数据泄露分析,显示了私有测试集的优势,同时在 Ko-H5 基准测试内进行了相关性研究以及 Ko-H5 分数的时间分析。此外,我们提供了实证支持,表明需要扩展基准测试集。我们希望 Open Ko-LLM 排行榜为扩展 LLM 评估以促进更多语言多样性树立先例。
引用
@article{arxiv.2405.20574,
title = {Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark},
author = {Chanjun Park and Hyeonwoo Kim and Dahyun Kim and Seonghwan Cho and Sanghoon Kim and Sukyung Lee and Yungi Kim and Hwalsuk Lee},
journal= {arXiv preprint arXiv:2405.20574},
year = {2024}
}
备注
Accepted at ACL 2024 Main