基于掩码时序插值扩散的程序规划
计算机视觉与模式识别
2025-07-08 v1
摘要
本文解决了教学视频中的程序规划挑战,旨在从起始和结束视觉观察中生成连贯且任务对齐的动作序列。以往工作主要依赖文本级监督来弥合观察状态与未观察动作之间的差距,但难以捕捉动作间复杂的时间关系。基于这些努力,我们提出了 Masked Temporal Interpolation Diffusion (MTID) 模型,在扩散模型中引入潜在空间时序插值模块。该模块利用可学习的插值矩阵生成中间潜在特征,从而丰富视觉监督。通过将这种丰富的监督整合到模型中,我们实现了针对任务特定需求的端到端训练,显著增强了模型预测时序连贯动作序列的能力。此外,我们引入了基于动作的掩码投影机制以限制动作生成空间,结合任务自适应掩码近似损失,以优先考虑给定起始和结束状态附近更准确的推理结果,而非中间步骤。同时,它过滤掉与任务无关的动作预测,导致情境感知的动作序列。实验结果显示,我们的 MTID 在三个广泛使用的基准数据集上实现了有前景的动作规划性能。代码可在 https://github.com/WiserZhou/MTID 获取。
引用
@article{arxiv.2507.03393,
title = {Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos},
author = {Yufan Zhou and Zhaobo Qi and Lingshuai Lin and Junqi Jing and Tingting Chai and Beichen Zhang and Shuhui Wang and Weigang Zhang},
journal= {arXiv preprint arXiv:2507.03393},
year = {2025}
}