Zo3T:基于测试时训练的零样本 3D 感知轨迹引导图像到视频生成
编程语言
2025-09-09 v1
摘要
轨迹引导的图像到视频 (I2V) 生成旨在合成符合用户指定运动指令的视频。现有方法通常依赖于在稀缺的标注数据集上进行计算昂贵的微调。尽管一些零样本方法尝试在潜在空间中进行轨迹控制,但它们可能因忽略 3D 透视并在被操纵的潜在表示与网络噪声预测之间造成错位,从而产生不切实际的运动。为了应对这些挑战,我们引入了 Zo3T,一个用于轨迹引导生成的全新零样本测试时训练框架,具有三项核心创新:首先,我们引入了 3D 感知运动学投影,利用推断的场景深度为目标区域推导出透视正确的仿射变换。其次,我们引入了轨迹引导测试时 LoRA,这是一种将短暂 LoRA 适配器与潜在状态一起动态注入并优化到去噪网络中的机制。在区域特征一致性损失的驱动下,这种协同适应有效地施加了运动约束,同时允许预训练模型将其内部表示局部适应于被操纵的潜在表示,从而确保生成保真度和流形一致性。最后,我们开发了引导场修正,通过一步前瞻策略优化条件引导场来细化去噪演化路径,确保向目标轨迹的高效生成推进。Zo3T 显著增强了轨迹控制 I2V 生成中的 3D 真实感和运动准确性,展现出优于现有基于训练和零样本方法的性能。
引用
@article{arxiv.2509.06724,
title = {Pacing Types: Safe Monitoring of Asynchronous Streams},
author = {Florian Kohn and Arthur Correnson and Jan Baumeister and Bernd Finkbeiner},
journal= {arXiv preprint arXiv:2509.06724},
year = {2025}
}