中文

MMTU:大规模多任务表格理解与推理基准

人工智能 2026-03-10 v4 计算与语言 数据库 机器学习

摘要

表格及其在众多实际应用中的作用至关重要,如电子表格、数据库和计算笔记本,传统上需要数据工程师、数据分析师和数据库管理员等专业用户才能操作。尽管大语言模型在处理表格方面取得了显著进展(如在电子表格和数据库 copilot 场景中),但针对此类能力的综合基准测试仍有限。与此不同,现有表格相关任务的评估稀缺且局限于NL-to-SQL和Table-QA等狭窄任务,忽略了专业用户所面临的更广泛真实任务。这一差距限制了我们对该重要领域的理解和模型进步。本文介绍MMTU,一个规模庞大的基准,包含28K以上问题覆盖25个真实世界表格任务,旨在全面评估模型理解、推理和操作真实表格的能力。这些任务源自数十年计算机科学关于表格数据的研究,聚焦于专业用户所面对的复杂表格任务。我们展示,MMTU需要表格理解、推理和编程等多项技能的组合,这些技能对当今前沿模型仍具挑战性,其中即便是前沿推理模型如OpenAI GPT-5和DeepSeek R1的得分仅约为69%和57%,表明仍有显著提升空间。我们在使用MMTU进行评估时发现了若干关键发现,希望该基准能推动结构化数据处理与分析领域的 foundation model进一步发展。我们的代码和数据已公开于https://github.com/MMTU-Benchmark/MMTU和https://huggingface.co/datasets/MMTU-benchmark/MMTU。

关键词

引用

@article{arxiv.2506.05587,
  title  = {MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark},
  author = {Junjie Xing and Yeye He and Mengyu Zhou and Haoyu Dong and Shi Han and Lingjiao Chen and Dongmei Zhang and Surajit Chaudhuri and H. V. Jagadish},
  journal= {arXiv preprint arXiv:2506.05587},
  year   = {2026}
}

备注

Full version of a paper accepted at NeurIPS 2025; Code and data available at https://github.com/MMTU-Benchmark/MMTU and https://huggingface.co/datasets/MMTU-benchmark/MMTU