DocPuzzle: 一个用于评估真实长上下文推理能力的面向过程的基准测试
人工智能
2025-02-26 v1
摘要
我们提出了DocPuzzle,一个严格构建的用于评估大语言模型(LLM)长上下文推理能力的基准。该基准包含100个需要基于长真实世界文档进行多步推理的专家级问答问题。为确保任务质量和复杂性,我们实现了人机协作标注验证流程。DocPuzzle引入了一种创新的评估框架,通过清单引导的过程分析来缓解猜测偏差,为评估LLM的推理能力建立了新标准。我们的评估结果显示:1)先进的慢思考推理模型如o1-preview(69.7%)和DeepSeek-R1(66.3%)显著优于最佳通用指令模型如Claude 3.5 Sonnet(57.7%);2)蒸馏推理模型如DeepSeek-R1-Distill-Qwen-32B(41.3%)远落后于教师模型,表明仅依靠蒸馏来维持推理能力的泛化面临挑战。
引用
@article{arxiv.2502.17807,
title = {DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities},
author = {Tianyi Zhuang and Chuqiao Kuang and Xiaoguang Li and Yihua Teng and Jihao Wu and Yasheng Wang and Lifeng Shang},
journal= {arXiv preprint arXiv:2502.17807},
year = {2025}
}