中文

KAIO:一套更具挑战性的韩语问题集

计算与语言 2025-09-19 v1

摘要

随着中/后训练技术的进步,LLMs正以前所未有的速度拓展其边界。遗留的基准测试很快达到饱和(例如,多年来广泛使用的MMLU套件,以及更新更快的GPQA-D),这使得前沿进展难以追踪。这个问题在韩语领域尤为突出:广泛使用的基准测试较少,通常是翻译版本或范围狭窄,且更新更慢,因此饱和和数据污染更早到来。因此,目前尚无能够评估和排名前沿模型的韩语基准测试。为弥补这一差距,我们引入了KAIO,一个以数学为核心的韩语基准测试,强调长链推理。与近期达到或接近饱和的韩语套件不同,KAIO远未达到饱和:表现最好的模型GPT-5得分为62.8,其次是Gemini-2.5-Pro(52.3)。开源模型如Qwen3-235B和DeepSeek-R1的得分低于30,展现出显著的上升空间,有助于稳健地追踪韩语领域的前沿进展。为减少数据污染,KAIO将保持私有并通过保留评估器提供服务,直到已知最佳公开模型达到至少80%的准确率,此后我们将发布该数据集并迭代到更难版本。

关键词

引用

@article{arxiv.2509.14752,
  title  = {KAIO: A Collection of More Challenging Korean Questions},
  author = {Nahyun Lee and Guijin Son and Hyunwoo Ko and Kyubeen Han},
  journal= {arXiv preprint arXiv:2509.14752},
  year   = {2025}
}

备注

4 pages paper