动作条件视频数据提升可预测性
计算机视觉与模式识别
2024-04-09 v1
摘要
长期视频生成与预测仍然是计算机视觉中的挑战性任务,尤其是在摄像机安装在移动平台上的部分可观测场景中。观测图像帧与记录智能体运动之间的相互作用引入了额外的复杂性。为了解决这些问题,我们引入了动作条件视频生成(Action-Conditioned Video Generation, ACVG)框架,这是一种通过深度双重生成器-执行器架构研究动作与生成图像帧之间关系的新方法。ACVG 根据机器人的动作生成视频序列,从而能够探索和分析在动态环境中视觉与动作如何相互影响。我们在一个室内机器人运动数据集上评估了该框架的有效性,该数据集由图像帧序列以及机器人智能体执行的动作序列组成;我们进行了全面的实证研究,将 ACVG 与其他最先进的框架进行比较,并进行了详细的消融研究。
引用
@article{arxiv.2404.05439,
title = {Action-conditioned video data improves predictability},
author = {Meenakshi Sarkar and Debasish Ghose},
journal= {arXiv preprint arXiv:2404.05439},
year = {2024}
}