何时重新承诺:长程视觉-语言推理的时间抽象发现
人工智能
2026-05-21 v3
摘要
长程推理不仅需要决定采取什么动作,还需要决定在下一次观察之前要承诺多深。我们将其形式化为 \emph{承诺深度}:在重新规划之间开环执行的原始动作数量。承诺深度在重新规划成本与累积执行误差之间引起了权衡,然而大多数现有的长程系统将其固定为手工设计的标量。在这项工作中,我们将承诺深度视为策略本身的可学习、状态条件变量。我们在一个模型原生的视觉-语言策略中实例化了这一点,该策略联合预测执行什么以及执行多久。在 Sliding Puzzle 和 Sokoban 上,由此产生的自适应策略帕累托优于所有非退化的固定深度基线,在每轮使用大约减少 25% 的原始动作的同时,求解率最高提升 12.5 个百分点。尽管使用了 7B 主干,我们的方法在两项任务上均优于 GPT-5.5 和 Claude Sonnet,而所有测试的开放权重视觉-语言模型零样本成功率均为 0%。我们进一步给出了理论分析,表明在标准承诺深度代理下,当局最优深度在不同状态间变化时,状态条件承诺严格优于任何固定深度。
引用
@article{arxiv.2605.09860,
title = {When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning},
author = {Chen Li and Zhantao Yang and Fangyi Chen and Han Zhang and Anudeepsekhar Bolimera and Marios Savvides},
journal= {arXiv preprint arXiv:2605.09860},
year = {2026}
}