视频预测模型作为通用视觉编码器
计算机视觉与模式识别
2024-05-28 v1
摘要
本研究探讨了开源视频条件生成模型作为下游任务编码器的潜力,重点是利用BAIR机器人推数据集进行实例分割。研究人员提出使用视频预测模型作为通用视觉编码器,利用其捕获关键空间和时间信息的能力,这对于实例分割等任务至关重要。受人类视觉研究,特别是格式塔共同命运原则的启发,该方法旨在开发一个代表图像中运动的潜在空间,以有效区分前景和背景信息。研究人员利用一个以输入帧为条件的3D矢量量化变分自编码器(3D VQVAE)视频生成编码器,并结合下游分割任务。实验涉及调整预训练的视频生成模型,分析其潜在空间,并训练用于前景-背景分割的自定义解码器。研究结果表明,利用生成式预训练学习进行下游任务具有前景,有助于在计算机视觉应用中实现增强的场景分析和分割。
引用
@article{arxiv.2405.16382,
title = {Video Prediction Models as General Visual Encoders},
author = {James Maier and Nishanth Mohankumar},
journal= {arXiv preprint arXiv:2405.16382},
year = {2024}
}