DOoM:困难的数学奥林匹克
人工智能
2025-11-14 v2
摘要
本文介绍了 DOoM,这是一个新的开源基准测试,旨在评估语言模型在解决俄语数学和物理问题方面的能力。该基准测试包含难度不同的问题,从学校水平的任务到大学奥林匹克和入学考试问题。本文讨论了其创建的动机,描述了数据集的结构和评估方法,并呈现了测试各种模型的初始结果。结果分析显示,模型性能与所使用的标记数呈相关性,并突显了数学任务与物理任务之间性能差异。
引用
@article{arxiv.2509.23529,
title = {DOoM: Difficult Olympiads of Math},
author = {Ilya Kuleshov and Ilin Pavel and Nikolay Kompanets and Ksenia Sycheva and Aleksandr Nikolich},
journal= {arXiv preprint arXiv:2509.23529},
year = {2025}
}