中文

修剪-规划:用于稳定前沿探索的步骤级校准

计算机视觉与模式识别 2025-11-26 v1 人工智能 机器人学

摘要

大型视觉语言模型(VLM)通过为开放词汇推理提供强大的语义先验,提高了具身问答(EQA)智能体的性能。然而,直接用于步骤级探索时,VLM常常表现出前沿振荡,因过度自信和校准不当而产生不稳定的来回运动,导致导航效率低下并影响答案质量。我们提出了修剪-规划(Prune-Then-Plan),一个简单且有效的框架,通过步骤级校准来稳定探索。与其信任原始VLM得分,我们的方法使用基于Holm-Bonferroni的修剪程序修剪不太可能的前沿选择,然后将最终决策委托给基于覆盖率的规划器。这种分离将过度自信的预测转化为保守且可解释的行动,通过依赖人类水平的判断来校准VLM的步骤级行为。集成到3D-Mem EQA框架后,我们的方法在视觉基础的SPL和LLM-Match指标上分别实现了最高49%和33%的相对提升。总体而言,在相同的探索预算下,我们的方法在OpenEQA和EXPRESS-Bench数据集上实现更好的场景覆盖。

关键词

引用

@article{arxiv.2511.19768,
  title  = {Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering},
  author = {Noah Frahm and Prakrut Patel and Yue Zhang and Shoubin Yu and Mohit Bansal and Roni Sengupta},
  journal= {arXiv preprint arXiv:2511.19768},
  year   = {2025}
}

备注

webpage: https://noahfrahm.github.io/Prune-Then-Plan-project-page/