中文

用于序列视频编译的渐进式傅里叶神经表示

计算机视觉与模式识别 2024-02-08 v3 人工智能 机器学习

摘要

神经隐式表示(NIR)近期受到显著关注,因为它能够将复杂高维数据编码到表示空间,并通过可训练的映射函数轻松重建。然而,NIR方法假设目标数据与表示模型之间为一对一映射,而不考虑数据的相关性或相似性。这导致其对多个复杂数据的泛化能力差,并限制了效率和可扩展性。受持续学习的启发,本工作研究如何在顺序编码会话中累积和迁移多个复杂视频数据的神经隐式表示。为克服NIR的局限,我们提出一种新方法——渐进式傅里叶神经表示(PFNR),旨在傅里叶空间中找到自适应且紧凑的子模块,以在每个训练会话中编码视频。这种稀疏化的神经编码使神经网络保有空闲权重,从而实现对未来视频的改进适配。此外,当学习新视频的表示时,PFNR以冻结权重迁移先前视频的表示。该设计使模型能够持续累积多个视频的高质量神经表示,同时确保无损解码,完美保留已学先前视频的表示。我们在UVG8/17和DAVIS50视频序列基准上验证了PFNR方法,相较强大的持续学习基线取得了令人印象深刻的性能提升。PFNR代码见 https://github.com/ihaeyong/PFNR.git。

关键词

引用

@article{arxiv.2306.11305,
  title  = {Progressive Fourier Neural Representation for Sequential Video Compilation},
  author = {Haeyong Kang and Jaehong Yoon and DaHyun Kim and Sung Ju Hwang and Chang D Yoo},
  journal= {arXiv preprint arXiv:2306.11305},
  year   = {2024}
}