FIN-bench-v2:评估芬兰大型语言模型的统一稳健基准套件
计算与语言
2025-12-16 v1 人工智能
摘要
我们介绍 FIN-bench-v2,一个用于评估芬兰语言大型模型的统一基准套件。FIN-bench-v2 将广泛使用的芬兰版本基准整合在内,同时更新并扩展了原始 FIN-bench,形成一个统一且格式一致的集合,涵盖阅读理解、常识推理、情感分析、世界知识和对齐等多个选择题和生成式任务。所有数据集均转换为 HuggingFace Datasets,包括 cloze 和 multiple-choice 提示表述的五种变体,并针对机器翻译资源如 GoldenSwag 和 XED 进行人工标注或审核。为选择稳健任务,我们预训练了一套 2.15B 参数的 decoder-only 模型,并利用其学习曲线计算单调性、信噪比、非随机性能以及模型排序一致性,仅保留满足所有标准的任务。我们进一步评估了较大的 instruction-tuned 模型,以刻画不同任务和提示表述下的性能。所有数据集、提示和评估配置均通过我们在 https://github.com/LumiOpen/lm-evaluation-harness 上的 fork 公开。补充资源在独立的仓库 https://github.com/TurkuNLP/FIN-bench-v2 中发布。
引用
@article{arxiv.2512.13330,
title = {FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models},
author = {Joona Kytöniemi and Jousia Piha and Akseli Reunamo and Fedor Vitiugin and Farrokh Mehryary and Sampo Pyysalo},
journal= {arXiv preprint arXiv:2512.13330},
year = {2025}
}