基于轨迹引导的扩散模型视频重建
计算机视觉与模式识别
2026-05-19 v1 机器学习
摘要
本文解决了在自动化水面车辆执行结构化海事机动的顶视无人机视频中重建丢失或掉帧的问题。我们提出了一个管道,将原始GPS遥测数据和单帧参考帧转换为使用预训练的图像到视频扩散模型生成的轨迹引导视频序列,无需特定领域的微调。通过等距圆面投影将 onboard telemetry logs 中的GPS坐标投影到图像空间,产生每艘船舶的运动线索作为SG-I2V扩散模型的条件输入。生成的帧使用感知、时间和轨迹基准指标对比于ground-truth视频,并对比于光流外推和RIFE插值基准。SG-I2V在所有方法中生成的帧最自然(BRISQUE 25.52,接近ground-truth 23.64),运动幅度最真实(时间平滑度1.14 vs. ground truth 1.42),且GPS轨迹遵循性最强(9.31px vs. 28.70px的ground-truth,后者反映了影片与GPS日志之间近似的时间对齐,而非生成误差),表明在挑战性的低纹理、小目标条件下,轨迹引导的扩散合成是可行的海事视频重建方法。
引用
@article{arxiv.2605.16420,
title = {Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance},
author = {Stelio Bompai and Ioannis Kontopoulos and Giannis Spiliopoulos and Dimitris Zissis and Konstantinos Tserpes},
journal= {arXiv preprint arXiv:2605.16420},
year = {2026}
}
备注
Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)