中文

STAR:通过拐点对齐与片段级DPO缓解空间推理中的级联错误

计算机视觉与模式识别 2026-04-02 v1

摘要

结构化空间导航是大型语言模型(LLM)空间推理的核心基准。现有的范式如思维可视化(VoT)在复杂拓扑中容易产生级联错误。为解决这一问题,我们提出STAR,一个基于拓扑锚点的两阶段框架,并引入RedMaze-23K数据集,其中包含人类启发的拐点标注。第一阶段使用监督微调帮助模型内化空间语义并剪枝冗余路径。第二阶段采用空间感知片段级直接偏好优化(SDPO)来细化长视野导航中的自我纠正。实验表明,STAR在开源模型中达到了最先进性能:其32B变体超越了DeepSeek-V3(29.27% vs. 25.00%),并达到了GPT-4性能的82.4%。

关键词

引用

@article{arxiv.2604.00558,
  title  = {STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO},
  author = {Pukun Zhao and Longxiang Wang and Chen Chen and Peicheng Wang and Fanqing Zhou and Runze Li and Haojian Huang},
  journal= {arXiv preprint arXiv:2604.00558},
  year   = {2026}
}

备注

9 pages, 6 figures, 4 tables, Accepted by ICME 2026