DTR:面向多媒体数据恢复的统一深度张量表示框架
计算机视觉与模式识别
2024-07-09 v1
摘要
近年来,基于变换的张量表示在多媒体数据(如图像和视频)恢复问题中受到越来越多的关注,它由两个不可或缺的组成部分构成,即变换和表征。以往,基于变换的张量表示的发展主要集中在变换方面。尽管有几次尝试使用浅层矩阵分解(例如奇异值分解和负矩阵分解)来表征变换后张量(称为潜在张量)的正面切片,但忠实表征方面仍未得到充分探索。为了解决这个问题,我们通过协同结合深度潜在生成模块和深度变换模块,提出了一个统一的深度张量表示(称为DTR)框架。特别是,与浅层矩阵分解相比,深度潜在生成模块能够忠实地生成潜在张量。新的DTR框架不仅使我们能够更好地理解经典的浅层表示,而且引导我们探索新的表示。为了检验所提出的DTR的表示能力,我们考虑了具有代表性的多维数据恢复任务,并提出了一个基于DTR的无监督多维数据恢复模型。大量实验表明,DTR在定量和定性方面均达到了优于最先进方法的性能,尤其是在精细细节恢复方面。
引用
@article{arxiv.2407.05267,
title = {DTR: A Unified Deep Tensor Representation Framework for Multimedia Data Recovery},
author = {Ting-Wei Zhou and Xi-Le Zhao and Jian-Li Wang and Yi-Si Luo and Min Wang and Xiao-Xuan Bai and Hong Yan},
journal= {arXiv preprint arXiv:2407.05267},
year = {2024}
}