中文

UA-Code-Bench:用于评估乌克兰语 LLM 代码生成的竞赛编程基准

计算与语言 2025-11-10 v1 人工智能 软件工程

摘要

在低资源语言中评估大型语言模型的实际能力仍然是一个挑战,因为许多现有基准聚焦于从英文翻译的常见任务,或仅评估简单语言理解。本文引入 UA-Code-Bench,一项新的开源基准,旨在全面评估语言模型在乌克兰语中的代码生成和竞赛编程问题解决能力。该基准包含来自 Eolymp 平台的 500 个问题,均匀分布在从非常容易到非常困难的五个难度级别。我们对 13 组主要的专有和开源模型进行了评估,模型基于 one-shot 提示生成 Python 解决方案,并通过专门的 Eolymp 环境对隐藏测试用例进行代码正确性评估。得到的结果显示,即便是表现最好的模型,如 OpenAI o3 和 GPT-5,也仅解决了一半的问题,凸显了低资源自然语言中代码生成的挑战。此外,本研究提供了对不同难度级别性能的全面分析,以及对解决方案唯一性和计算效率的评估,后者通过生成解决方案的消耗时间和内存消耗进行衡量。总之,本工作证明了竞赛编程基准在评估大型语言模型方面的价值,尤其是在缺乏代表性的语言方面。它为未来在多语言代码生成和基于推理增强的模型方面的研究之路。该基准、数据解析、准备、代码生成和评估脚本均可在 https://huggingface.co/datasets/NLPForUA/ua-code-bench 上获得。

关键词

引用

@article{arxiv.2511.05040,
  title  = {UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian},
  author = {Mykyta Syromiatnikov and Victoria Ruvinskaya},
  journal= {arXiv preprint arXiv:2511.05040},
  year   = {2025}
}

备注

8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)