中文

面向视频探索、编辑与传输的视频专用自编码器

计算机视觉与模式识别 2022-01-11 v2 图形学 人机交互 机器学习

摘要

我们研究视频专用自编码器,使人类用户能够探索、编辑并高效传输视频。先前的工作已独立考察了这些问题(及其子问题)并提出了不同的表述。在本工作中,我们在特定视频的多帧上(从头开始)训练一个简单的自编码器。我们观察到:(1) 视频专用自编码器学习到的潜变量编码捕捉了该视频的空间与时间特性;(2) 自编码器可将样本外输入投影到视频专用流形上。这两个特性使我们能够利用一种学习到的表示来探索、编辑并高效传输视频。例如,对潜变量编码进行线性操作可使用户可视化视频内容。将视频的潜变量编码与流形投影相关联,可使用户进行所需编辑。对潜变量编码进行插值并结合流形投影,可通过网络传输稀疏低分辨率帧。

关键词

引用

@article{arxiv.2103.17261,
  title  = {Video-Specific Autoencoders for Exploring, Editing and Transmitting Videos},
  author = {Kevin Wang and Deva Ramanan and Aayush Bansal},
  journal= {arXiv preprint arXiv:2103.17261},
  year   = {2022}
}

备注

Project Page: https://www.cs.cmu.edu/~aayushb/Video-ViSA/