QuaDreamer:为四足机器人生成可控全景视频的框架
摘要
全景相机能够捕获360度环境数据的综合性数据,适用于四足机器人在复杂环境中的周围感知和交互。然而,由于先天的运动学约束和复杂的传感器标定挑战,导致高质量全景训练数据稀缺,这从根本上限制了针对这些具身平台开发稳健感知系统的能力。为此,我们提出QuaDreamer——首个专为四足机器人设计的全景数据生成引擎。QuaDreamer专注于模拟四足机器人的运动范式,以生成高度可控且逼真的全景视频,为下游任务提供数据源。具体而言,为有效捕捉四足 locomotion期间所表现出的独特垂直振动特征,我们引入了垂直抖动编码(Vertical Jitter Encoding, VJE)。VJE通过频域特征滤波提取可控垂直信号,并提供高质量的提示。为 facilitate 在抖动信号控制下进行高质量全景视频生成,我们提出了场景-对象控制器(Scene-Object Controller, SOC),通过注意力机制有效管理对象运动并提升背景抖动控制效果。为解决宽视场视频生成中的全景畸变问题,我们提出了全景增强器(Panoramic Enhancer, PE)——一种双流架构,协同利用频率-纹理细化实现局部细节增强,以及空间-结构校正实现全局几何一致性。我们进一步展示了生成的视频序列可作为四足机器人全景视觉感知模型的训练数据,从而提升360度场景中多目标跟踪的性能。源代码和模型权重将在 https://github.com/losehu/QuaDreamer 上公开。
引用
@article{arxiv.2508.02512,
title = {QuaDreamer: Controllable Panoramic Video Generation for Quadruped Robots},
author = {Sheng Wu and Fei Teng and Hao Shi and Qi Jiang and Kai Luo and Kaiwei Wang and Kailun Yang},
journal= {arXiv preprint arXiv:2508.02512},
year = {2025}
}
备注
Accepted to CoRL 2025. The source code and model weights will be publicly available at https://github.com/losehu/QuaDreamer