Computation and Language · Computer Science
Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai +16
2024-12-25
Computation and Language · Computer Science
STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsing
Jiaru Zou, Qing Wang, Pratyush Thakur, Nickvash Kani
2025-06-03
Computation and Language · Computer Science
SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials
Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang +5
2025-09-26
Computation and Language · Computer Science
MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data
Meng Fang, Xiangpeng Wan, Fei Lu, Fei Xing +1
2024-06-27
Artificial Intelligence · Computer Science
RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning
Ziye Chen, Chengwei Qin, Yao Shu
2025-09-10
Computation and Language · Computer Science
RuMedBench: A Russian Medical Language Understanding Benchmark
Pavel Blinov, Arina Reshetnikova, Aleksandr Nesterov, Galina Zubkova +1
2022-07-14
Computation and Language · Computer Science
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao +1
2026-04-14
Artificial Intelligence · Computer Science
RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
Jie Zhang, Cezara Petrui, Kristina Nikolić, Florian Tramèr
2025-10-21
Computation and Language · Computer Science
AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
Shengnan An, Xunliang Cai, Xuezhi Cao, Xiaoyu Li +7
2025-10-31
Computation and Language · Computer Science
OLMES: A Standard for Language Model Evaluations
Yuling Gu, Oyvind Tafjord, Bailey Kuehl, Dany Haddad +2
2025-02-12
Artificial Intelligence · Computer Science
OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
Yaoming Zhu, Junxin Wang, Yiyang Li, Lin Qiu +7
2025-06-13
Artificial Intelligence · Computer Science
LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang +5
2025-12-23
Computation and Language · Computer Science
UNVEILING: What Makes Linguistics Olympiad Puzzles Tricky for LLMs?
Mukund Choudhary, KV Aditya Srivatsa, Gaurja Aeron, Antara Raaghavi Bhattacharya +5
2025-08-18
Physics Education · Physics
Evaluating GPT- and Reasoning-based Large Language Models on Physics Olympiad Problems: Surpassing Human Performance and Implications for Educational Assessment
Paul Tschisgale, Holger Maus, Fabian Kieser, Ben Kroehs +2
2025-07-02
Neural and Evolutionary Computing · Computer Science
Benchmarking Continuous Dynamic Multi-Objective Optimization: Survey and Generalized Test Suite
Chang Shao, Qi Zhao, Nana Pu, Shi Cheng +2
2026-01-06
Artificial Intelligence · Computer Science
Brains vs. Bytes: Evaluating LLM Proficiency in Olympiad Mathematics
Hamed Mahdavi, Alireza Hashemi, Majid Daliri, Pegah Mohammadipour +5
2025-04-14
Computation and Language · Computer Science
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
Wentao Liu, Qianjun Pan, Yi Zhang, Zhuo Liu +6
2024-11-04
Computation and Language · Computer Science
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
Sadegh Mahdavi, Muchen Li, Kaiwen Liu, Christos Thrampoulidis +2
2025-06-30
Computation and Language · Computer Science
Scaling Physical Reasoning with the PHYSICS Dataset
Shenghe Zheng, Qianjia Cheng, Junchi Yao, Mengsong Wu +8
2025-10-20
Computation and Language · Computer Science
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko +72
2026-05-20
Computation and Language · Computer Science
NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding
Chunkit Chan, Cheng Jiayang, Yauwai Yim, Zheye Deng +6
2024-10-08