中文

VONet:基于并行 U-Net 注意力与对象级序列 VAE 的无监督视频对象学习

计算机视觉与模式识别 2024-01-23 v1 机器学习

摘要

无监督视频对象学习旨在不依赖深度、光流或分割等任何监督信号的情况下,将视频场景分解为结构化的对象表示。我们提出了 VONet,这是一种受 MONet 启发的新颖方法。VONet 利用 U-Net 架构,采用高效且有效的并行注意力推断过程,同时为所有槽位生成注意力掩码。此外,为了增强连续视频帧中每个掩码的时间一致性,VONet 开发了一个对象级序列 VAE 框架。这些创新的编码器端技术与基于 Transformer 的强表达力解码器相结合,使 VONet 成为涵盖不同复杂度视频的五个 MOVI 数据集上领先的无监督对象学习方法。代码可在 https://github.com/hnyu/vonet 获取。

关键词

引用

@article{arxiv.2401.11110,
  title  = {VONet: Unsupervised Video Object Learning With Parallel U-Net Attention and Object-wise Sequential VAE},
  author = {Haonan Yu and Wei Xu},
  journal= {arXiv preprint arXiv:2401.11110},
  year   = {2024}
}

备注

ICLR 2024