中文

利用生成模型变换静态图像用于视频显著目标检测

计算机视觉与模式识别 2024-11-22 v1

摘要

在许多视频处理任务中,利用大规模图像数据集是一种常见策略,因为图像数据更丰富,便于全面的知识迁移。从静态图像模拟视频的典型方法是应用空间变换,如仿射变换和样条扭曲,以创建模拟时间演进的序列。然而,在视频显著目标检测等任务中,外观和运动线索都至关重要,这些基本的图像到视频技术无法生成捕捉每个物体独立运动属性的真实光流。在本研究中,我们表明图像到视频扩散模型可以生成静态图像的真实变换,同时理解图像组件之间的上下文关系。这种能力使模型能够生成合理的光流,保持语义完整性,同时反映场景元素的独立运动。通过这种方式增强单个图像,我们创建了大规模图像-流对,显著增强了模型训练。我们的方法在所有公共基准数据集上实现了最先进的性能,优于现有方法。

关键词

引用

@article{arxiv.2411.13975,
  title  = {Transforming Static Images Using Generative Models for Video Salient Object Detection},
  author = {Suhwan Cho and Minhyeok Lee and Jungho Lee and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2411.13975},
  year   = {2024}
}