中文

KoSimpleQA:面向韩语事实性基准测试及对推理型大语言模型的分析

计算与语言 2025-10-22 v1

摘要

我们提出了韩语 SimpleQA(KoSimpleQA),这是一套用于评估大语言模型(LLM)在韩语文化知识方面事实性基准的数据集。KoSimpleQA 旨�既具挑战性又易于评分,包含 1000 个简短、事实寻求问题且答案明确无歧义。我们对支持韩语的各类规模的开源 LLM 进行了全面评估,发现即使是最强模型也仅在 33.7% 的情况下生成正确答案,凸显了 KoSimpleQA 的具备挑战性。值得注意的是,KoSimpleQA 上的性能排名与 English SimpleQA 的排名有显著差异,凸显了该数据集的独特价值。此外,我们对推理型 LLM 的分析显示,激发推理能力在事实 QA 任务中既能帮助模型更好地发掘潜在知识,又能提高其在不确定时放弃回答的能力。KoSimpleQA 可在 https://anonymous.4open.science/r/KoSimpleQA-62EB 上获取。

关键词

引用

@article{arxiv.2510.18368,
  title  = {KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs},
  author = {Donghyeon Ko and Yeguk Jin and Kyubyung Chae and Byungwook Lee and Chansong Jo and Sookyo In and Jaehong Lee and Taesup Kim and Donghyun Kwak},
  journal= {arXiv preprint arXiv:2510.18368},
  year   = {2025}
}