中文

伪代码引导的结构化推理:自动化视觉语言模型可靠推断框架

人工智能 2026-05-20 v1

摘要

视觉语言模型(VLMs)正成为机器人自动化中高级推理的基石,使其能够解析自然语言指令并感知其环境。然而,由于对幻觉的脆弱性,这些模型在决策中会引发关键性故障,构成实际部署中的安全和可靠性风险。这一挑战因现实任务的开放性而加剧,其中问题难度和模态差异巨大,要求具备稳健且可适应的推理策略。为此,我们提出伪代码引导的结构化推理框架(PStar),该框架自适应选择结构化伪代码推理路径,以帮助VLMs执行灵活且逐步的推理。我们首先设计一组抽象推理函数,并构建结构化伪代码库以表示模块化推理策略。关键在于,我们设计了难度特征向量(DFV),使模型能够评估问题复杂度并自适应选择合适的推理策略,从而提升鲁棒性和可解释性。广泛的实验表明,PStar显著降低了幻觉率,在POPE上实现最高87.1%的得分,在MMStar上达到68.0%,超越甚至是GPT-4V。通过提供一种validated机制来减少视觉语言错误,PStar为在实际自动化系统中部署更可信、更确定性的VLMs提供了关键一步,因为此类错误可能导致灾难性后果。

关键词

引用

@article{arxiv.2605.19663,
  title  = {Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models},
  author = {Weicong Ni and Tianbao Jiang and Linlin Wang},
  journal= {arXiv preprint arXiv:2605.19663},
  year   = {2026}
}