中文

T4DT:对时间进行张量化以学习时序三维视觉数据

计算机视觉与模式识别 2022-10-06 v2

摘要

与二维光栅图像不同,三维视觉数据处理尚无单一主导表示形式。点云、网格或隐式函数等不同格式各有优劣。尽管如此,有符号距离函数等网格表示在三维中同样具有吸引人的特性,特别是提供常数时间随机访问,且非常适于现代机器学习。遗憾的是,网格的存储大小随维度呈指数增长,因此在中等分辨率下也常超出内存限制。本文提出使用低秩张量格式(包括 Tucker、张量列和量子张量列分解)来压缩时变三维数据。我们的方法迭代地计算、体素化并压缩每一帧的截断有符号距离函数,并应用张量秩截断将所有帧压缩为表示整个四维场景的单一压缩张量。我们表明,低秩张量压缩在存储和查询时变有符号距离函数时极为紧凑,在显著保持几何质量的同时大幅降低四维场景的内存占用。与 DeepSDF 和 NeRF 等现有的基于迭代学习的方法不同,我们的方法采用具有理论保证的闭式算法。

关键词

引用

@article{arxiv.2208.01421,
  title  = {T4DT: Tensorizing Time for Learning Temporal 3D Visual Data},
  author = {Mikhail Usvyatsov and Rafael Ballester-Rippoll and Lina Bashaeva and Konrad Schindler and Gonzalo Ferrer and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2208.01421},
  year   = {2022}
}