VONet:基于并行 U-Net 注意力与对象级序列 VAE 的无监督视频对象学习
计算机视觉与模式识别
2024-01-23 v1 机器学习
摘要
无监督视频对象学习旨在不依赖深度、光流或分割等任何监督信号的情况下,将视频场景分解为结构化的对象表示。我们提出了 VONet,这是一种受 MONet 启发的新颖方法。VONet 利用 U-Net 架构,采用高效且有效的并行注意力推断过程,同时为所有槽位生成注意力掩码。此外,为了增强连续视频帧中每个掩码的时间一致性,VONet 开发了一个对象级序列 VAE 框架。这些创新的编码器端技术与基于 Transformer 的强表达力解码器相结合,使 VONet 成为涵盖不同复杂度视频的五个 MOVI 数据集上领先的无监督对象学习方法。代码可在 https://github.com/hnyu/vonet 获取。
引用
@article{arxiv.2401.11110,
title = {VONet: Unsupervised Video Object Learning With Parallel U-Net Attention and Object-wise Sequential VAE},
author = {Haonan Yu and Wei Xu},
journal= {arXiv preprint arXiv:2401.11110},
year = {2024}
}
备注
ICLR 2024