ViterbiPlanNet:通过可微分 Viterbi 注入程序知识用于指令视频规划
计算机视觉与模式识别
2026-03-05 v1
摘要
程序规划旨在预测将初始视觉状态转化为目标所需的动作序列,是复杂环境中智能体的基本能力。现有方法通常依赖大规模模型在隐式中学习程序结构,导致样本效率有限且计算成本高。本文引入 ViterbiPlanNet,一个原则化的框架,通过可微分 Viterbi 层 (DVL) 显式地将程序知识整合到学习过程中。DVL 将程序知识图 (PKG) 直接嵌入 Viterbi 解码算法中,用平滑松弛取代非可微分操作,以实现端到端优化。该设计允许模型通过图基解码学习。在 CrossTask、COIN 和 NIV 上的实验表明,ViterbiPlanNet 以比扩散和 LLM 基于规划器少一个数量级的参数,实现了最先进的性能。广泛的消融实验表明,性能提升源于我们可微分的结构感知训练而非事后精炼,导致样本效率和对更短不可见时域的鲁棐性得到改善。我们也解决了测试不一致性,建立了统一的测试协议,包括一致的划分和评估指标。通过该新协议,我们多次运行实验并使用自助法报告结果以评估统计显著性。
引用
@article{arxiv.2603.04265,
title = {ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos},
author = {Luigi Seminara and Davide Moltisanti and Antonino Furnari},
journal= {arXiv preprint arXiv:2603.04265},
year = {2026}
}
备注
Accepted at CVPR 2026