中文

STELAR-VISION:面向视觉对齐推理的自拓扑感知高效学习框架

人工智能 2026-02-11 v4 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)在推理方面取得了长足进步,但它们常常难以处理复杂的多模态任务,并倾向于生成过于冗长的输出。一个关键限制是它们依赖于思维链(CoT)推理,尽管许多任务受益于树或图等替代拓扑结构。为解决这一问题,我们引入了STELAR-Vision,一个用于拓扑感知推理的训练框架。其核心是TopoAug,一个通过多样化拓扑结构丰富训练的合成数据流水线。我们使用监督微调和强化学习,兼顾准确性和效率,对Qwen2VL模型进行后训练。此外,我们提出了Frugal Learning,在最小化精度损失的同时减少输出长度。在MATH-V和VLM-S2H上,STELAR-Vision的准确率比其基座模型提高了9.7%,并比更大的Qwen2VL-72B-Instruct高出7.3%。在五个分布外基准测试中,它比Phi-4-Multimodal-Instruct最多高出28.4%,比LLaMA-3.2-11B-Vision-Instruct最多高出13.2%,展现出强大的泛化能力。与仅使用链式训练相比,我们的方法在分布内数据集上的总体准确率提高了4.3%,并在所有分布外基准测试中持续表现更优。

关键词

引用

@article{arxiv.2508.08688,
  title  = {STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision},
  author = {Chen Li and Han Zhang and Zhantao Yang and Fangyi Chen and Zihan Wang and Anudeepsekhar Bolimera and Marios Savvides},
  journal= {arXiv preprint arXiv:2508.08688},
  year   = {2026}
}

备注

This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings