OpenHuEval:在匈牙利语特性上评估大型语言模型
计算与语言
2025-08-26 v2
摘要
我们介绍了 OpenHuEval,这是首个专注于匈牙利语及其特性的 LLM 基准。OpenHuEval 由来源于多种渠道的大量匈牙利语特定材料构建而成。在构建过程中,我们纳入了评估 LLM 的最新设计原则,例如使用来自互联网的真实用户查询,强调对 LLM 生成能力的评估,并采用 LLM-as-judge 以增强评估的多维性与准确性。最终,OpenHuEval 涵盖八个匈牙利语特定维度,包含五项任务和 3953 个问题。因此,OpenHuEval 为 LLM 在匈牙利语及其特性背景下的表现提供了全面、深入且科学准确的评估。我们评估了当前主流的 LLM,包括传统 LLM 和近期开发的大型推理模型。结果表明,针对匈牙利语及其特性进行评估和模型优化具有显著的必要性。我们还建立了利用 OpenHuEval 分析 LRM 思维过程的框架,以匈牙利语为代表案例,揭示了这些模型在非英语语言中的内在模式与机制。我们将在 https://github.com/opendatalab/OpenHuEval 发布 OpenHuEval。
引用
@article{arxiv.2503.21500,
title = {OpenHuEval: Evaluating Large Language Model on Hungarian Specifics},
author = {Haote Yang and Xingjian Wei and Jiang Wu and Noémi Ligeti-Nagy and Jiaxing Sun and Yinfan Wang and Zijian Győző Yang and Junyuan Gao and Jingchao Wang and Bowen Jiang and Shasha Wang and Nanjun Yu and Zihao Zhang and Shixin Hong and Hongwei Liu and Wei Li and Songyang Zhang and Dahua Lin and Lijun Wu and Gábor Prószéky and Conghui He},
journal= {arXiv preprint arXiv:2503.21500},
year = {2025}
}