从分解运动学到行动条件外科视频生成的路由化视觉控制
计算机视觉与模式识别
2026-05-12 v1
摘要
行动条件外科视频生成是一个关键但极具挑战性的问题,因为低维控制向量必须精确控制复杂的图像空间演化。在本工作中,我们提出了一种运动学到视觉的提升范式,将分解运动学转换为统一的五组图像对齐控制模态。基于此表示,我们引入层次化路由视觉控制框架,选择性激活最相关的控制模态和运动尺度。而非均匀应用所有控制信号,我们的模型执行层次化路由以动态分配条件容量。我们进一步设计运动学先验导向的路由损失函数,以确保物理上有意义、时序稳定且高效的专家利用。为提高效率,我们提出一种受预算约束的训练和推理方案,利用路由引起的稀疏性。在训练和执行期间,通过选择性丢弃低意义控制通道,我们的方法实现了适用于标准蒸馏的自适应计算。我们另外构建了一个新的基准,包含经过人类在回中的语义标注和可微姿态跟踪获得的精选分解注释,为行动条件外科视频生成提供了真实的监督。广泛的实验表明,我们的方法在行动忠实性、视觉保真度和跨域泛化方面 consistently 优于多样化的基线。此外,我们的高效变体在保持强控制准确性的同时显著降低了延迟。
引用
@article{arxiv.2605.08712,
title = {From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation},
author = {Bohan Li and Shuojue Yang and Baorui Peng and Xianda Guo and Erli Zhang and Youqi Tao and Junfeng Duan and Daguang Xu and Qi Dou and Xin Jin and Wenjun Zeng and Hao Zhao and Yueming Jin},
journal= {arXiv preprint arXiv:2605.08712},
year = {2026}
}