FreeAction: 用于提升轨迹到视频生成保真度的无训练技术
计算机视觉与模式识别
2025-09-30 v1 机器人学
摘要
从显式动作轨迹生成逼真的机器人视频是构建有效世界模型和机器人基础模型的关键步骤。我们引入了两种无训练的推理时技术,充分利用扩散型机器人视频生成中的显式动作参数。与其将动作向量视为被动的条件信号,我们的方法主动将其纳入,以引导无分类器引导过程和高斯潜变量的初始化。首先,动作缩放的无分类器引导根据动作幅度动态调节引导强度,增强对运动强度的可控性。其次,动作缩放的噪声截断调整初始采样噪声的分布,以更好地与期望的运动动力学对齐。在真实机器人操作数据集上的实验表明,这些技术显著改善了多样化机器人环境中的动作一致性和视觉质量。
引用
@article{arxiv.2509.24241,
title = {FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation},
author = {Seungwook Kim and Seunghyeon Lee and Minsu Cho},
journal= {arXiv preprint arXiv:2509.24241},
year = {2025}
}
备注
8 pages, 4 figures, accepted to CoRL 2025 LSRW workshop