粗到细张量列用于紧凑视觉表征
计算机视觉与模式识别
2024-06-07 v1 机器学习
摘要
学习紧凑、高质量且易于优化的视觉数据表征对于诸如新视角合成和3D重建等众多应用至关重要。最近的工作表明,使用张量网络来设计此类紧凑且高质量的表征取得了显著成功。然而,优化基于张量的表征,特别是高度紧凑的张量列表征,仍然不具备能力。这阻碍了实践者充分发挥张量网络在视觉数据中的潜能。为此,我们提出了“延长上采样张量列(PuTT)”,一种以粗到细方式学习张量列表征的新方法。我们的方法涉及对已学习的张量列表征进行延长或上采样,创建一系列逐步细化的“粗到细”张量列。我们沿三个维度评估了该表征:(1)压缩率,(2)去噪能力,(3)图像完成能力。为评估这些维度,我们考虑图像拟合、3D拟合和新视角合成任务,其中我们的方法比当前基于张量的方法在性能上取得了改进。欲了解完整结果,请参阅我们的项目网页:https://sebulo.github.io/PuTT_website/
引用
@article{arxiv.2406.04332,
title = {Coarse-To-Fine Tensor Trains for Compact Visual Representations},
author = {Sebastian Loeschcke and Dan Wang and Christian Leth-Espensen and Serge Belongie and Michael J. Kastoryano and Sagie Benaim},
journal= {arXiv preprint arXiv:2406.04332},
year = {2024}
}
备注
Project webpage: https://sebulo.github.io/PuTT_website/