中文

语义引导的层次化视频预测:先于像素的表征

计算机视觉与模式识别 2026-04-14 v1

摘要

准确的未来视频预测需要高视觉保真度和一致的场景语义,尤其是在复杂动态环境中,如自动驾驶领域。我们提出了 Re2Pix,一个层次化视频预测框架,将预测分解为两个阶段:语义表征预测和表征引导的视觉合成。不同于直接预测未来RGB帧,我们的方法首先在冻结的视觉基础模型特征空间中预测未来场景结构,然后将这些预测的表征作为条件输入到潜扩散模型中,以生成逼真的帧。这种分解使模型能够先关注场景动态,再关注外观生成。一个关键挑战在于训练时可获得的真实表征与推理时预测的表征之间的 train-test 不匹配。为此,我们引入两种条件策略:嵌套丢弃和混合监督,以提高对不完美自回归预测的鲁棒性。在具有挑战性的驾驶基准测试上实验表明,所提出的语义优先设计显著优于强大的扩散基线,在时序语义一致性、感知质量和训练效率方面均有所提升。我们在 https://github.com/Sta8is/Re2Pix 提供了实现代码。

关键词

引用

@article{arxiv.2604.11707,
  title  = {Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction},
  author = {Efstathios Karypidis and Spyros Gidaris and Nikos Komodakis},
  journal= {arXiv preprint arXiv:2604.11707},
  year   = {2026}
}