中文

面向基于视觉的遥操作的生成式预测显示:现成视频模型的零样本基准测试

机器人学 2026-05-12 v1 计算机视觉与模式识别

摘要

遥操作系统从根本上受到通信延迟的限制,这会降低态势感知和控制性能。预测显示旨在通过呈现当前视觉状态的估计而非延迟观测来缓解这一限制。尽管生成式视频模型的最新进展使得高质量视频合成成为可能,但它们是否适用于对延迟敏感的预测显示仍不清楚。本文提出了一种针对现成生成式视频模型在短时域预测显示中的零样本基准测试,无需特定任务的微调。我们将该问题表述为基于展开的未来帧预测,并使用来自 CARLA 模拟器的模拟驾驶数据开发了统一的基准测试流水线。在两种分辨率和两种条件设置(多帧和单帧)下,评估了跨越基于 Transformer 和基于扩散系列的五个公开发布的视频模型。使用预测精度(平均绝对差)、每次展开延迟、峰值 GPU 内存使用量以及预测时域上的时间误差演变来评估性能。在此零样本基准测试中,没有测试模型能够同时实现低展开误差、非发散的逐步误差行为以及以源帧率进行实时推理。增加模型规模或分辨率带来的改进有限,在某些情况下甚至出现反向改进。这些发现突显了通用生成式视频合成与遥操作中预测显示要求之间的差距,表明实际部署将需要显式的短时域时间监督、领域内适应或激进的推理优化,而不是直接应用现成模型。代码、配置和定性结果已在项目页面发布:https://bimilab.github.io/paper-GenPD

关键词

引用

@article{arxiv.2605.09670,
  title  = {Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models},
  author = {Aws Khalil and Jaerock Kwon},
  journal= {arXiv preprint arXiv:2605.09670},
  year   = {2026}
}