光未来:基于 InstructPix2Pix 的多模态动作帧预测
计算机视觉与模式识别
2025-11-05 v2 多媒体
机器人学
摘要
预测未来运动轨迹是机器人、自动驾驶系统和人类活动预测等领域的关键能力,能够实现更安全和更智能的决策。本文提出了一种新颖、高效且轻量级的方法,用于机器人动作预测,相较于传统视频预测模型在计算成本和推理延迟方面具有显著优势。重要的是,我们首次将 InstructPix2Pix 模型适用于预测机器人任务中未来视觉帧,扩展了其超越静态图像编辑的用途。我们实现了一个基于深度学习的视觉预测框架,给定当前图像和文本指令,预测机器人将在 100 帧(10 秒)后看到的画面。我们重新定位和微调 InstructPix2Pix 模型以接受视觉和文本输入,实现多模态未来帧预测。在基于真实场景生成的 RoboTWin 数据集上进行实验,表明该方法在机器人动作预测任务中在 SSIM 和 PSNR 上优于最先进的基线方法。不同于需要多个输入帧、重型计算和慢推理延迟的传统视频预测模型,本方法仅需要一张图像和一个文本提示作为输入。这种轻量级设计实现了更快的推理、更低的 GPU 需求以及灵活的多模态控制,特别适用于机器人和体育运动轨迹分析等应用场景,优先考虑运动轨迹精度而非视觉保真度。
引用
@article{arxiv.2507.14809,
title = {Light Future: Multimodal Action Frame Prediction via InstructPix2Pix},
author = {Zesen Zhong and Duomin Zhang and Yijia Li},
journal= {arXiv preprint arXiv:2507.14809},
year = {2025}
}
备注
9 pages including appendix, 4 tables, 8 figures, to be submitted to WACV 2026