生成式时空数据增强
计算机视觉与模式识别
2025-12-16 v1 机器学习
摘要
我们探索使用视频基础模型进行时空数据增强,以丰富相机视角与场景动态。不同于基于简单几何变换或外观扰动的现有方法,我们的方法利用现成的视频扩散模型,从给定图像数据集生成逼真的三维空间与时间变化。将这些合成的视频片段作为补充训练数据,在低数据场景下(如标注稀缺的无人机采集图像)带来了持续的性能提升。除了经验性改进外,我们还提供了实用指南,用于 选择合适的时空生成设置, 将标注迁移至合成帧,以及 处理去遮挡——即在生成视图中新暴露且未标注的区域。在 COCO 子集和无人机采集数据集上的实验表明,若审慎应用,时空增强能够沿着传统方法与先前生成方法未能充分覆盖的维度扩展数据分布,为数据稀缺场景下提升模型性能提供有效手段。
引用
@article{arxiv.2512.12508,
title = {Generative Spatiotemporal Data Augmentation},
author = {Jinfan Zhou and Lixin Luo and Sungmin Eum and Heesung Kwon and Jeong Joon Park},
journal= {arXiv preprint arXiv:2512.12508},
year = {2025}
}