Internalized Reasoning for Long-Context Visual Document Understanding
计算机视觉与模式识别
2026-04-06 v1 人工智能
计算与语言
摘要
视觉长文档理解对于企业、法律和科学应用至关重要,但目前最好的开源配方尚未探索推理能力,这一能力已驱动数学和代码性能的飞跃。我们构建了一个用于长文档理解中推理的合成数据管道,通过对每页进行相关性评分来生成思维轨迹,提取文本证据并从最相关到最不相关对其进行排序。我们对结果中的推理轨迹应用 SFT,使用 标签内的推理,由 控制标记控制,最终通过低强度模型融合实现推理能力的内化。我们研究了 Qwen3 VL 32B 和 Mistral Small 3.1 24B。使用 Qwen3 VL,我们在 MMLongBenchDoc 上实现了 58.3 分,超越了 7 倍更大的 Qwen3 VL 235B A22B(57.0 分)。使用 Mistral,合成推理在 MMLBD-C 上比从 Thinking 版本的轨迹蒸馏高出 3.8 分,内化推理相对于显式推理仅使用了平均 12.4 倍更少的输出 token。我们发布了这个管道,以便可重复性和进一步探索。
引用
@article{arxiv.2604.02371,
title = {Internalized Reasoning for Long-Context Visual Document Understanding},
author = {Austin Veselka},
journal= {arXiv preprint arXiv:2604.02371},
year = {2026}
}
备注
9 pages