中文

$\pi^2$:源结构推理数据提升大语言模型的长程推理能力

计算与语言 2026-04-08 v1 人工智能 机器学习

摘要

我们研究了一条从初始结构化数据中筛选推理数据以提升大语言模型(LLM)长程推理能力的管道。我们的方法,π2\pi^2,通过严格的 QA 筛选构建高质量推理数据:1)从 Wikipedia 中提取并扩展表格;2)从收集的表格和相关上下文中生成真实且多跳的分析性推理问题,其答案通过双路径代码执行自动确定并验证;3)将逐步结构化推理痕迹反译为给定真实 web 搜索上下文中 QA 对的解决方案。对 \textscgptoss20b\textsc{\small{gpt-oss-20b}}\textscQwen34BInstruct2507\textsc{\small{Qwen3-4B-Instruct-2507}}π2\pi^2上的监督式微调,均在四个长程推理基准测试及其相似的π2\pi^2-Bench 上实现持续的性能提升,平均绝对准确率提升分别为 +4.3% 和 +2.7%。值得注意的是,我们的数据集促进了自蒸馏,\textscgptoss20b\textsc{\small{gpt-oss-20b}} 甚至通过自身的推理痕迹提升了平均性能 +4.4%,这证明了π2\pi^2的实用性。我们的代码、数据和模型已在 https://github.com/vt-pi-squared/pi-squared 上开源。

关键词

引用

@article{arxiv.2604.05114,
  title  = {$\pi^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models},
  author = {Quyet V. Do and Thinh Pham and Nguyen Nguyen and Sha Li and Pratibha Zunjare and Tu Vu},
  journal= {arXiv preprint arXiv:2604.05114},
  year   = {2026}
}

备注

Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs