Uni4D:面向点云视频的统一自监督学习框架
计算机视觉与模式识别
2025-05-21 v2
摘要
点云视频的自监督表征学习仍面临两个关键局限:(1)现有方法依赖显式知识来学习运动,导致表征次优;(2)先前的掩码自编码器(MAE)框架难以在 4D 数据中桥接低层几何与高层动态之间的差距。为此,本文提出一种新型自解耦 MAE,用于学习富有表达力、判别性强且可迁移的 4D 表征。为克服第一个局限,我们通过在潜在空间中对齐高层语义来学习运动,而无需任何显式知识。为应对第二个挑战,我们引入一种自解耦学习策略,将潜在 token 与几何 token 融合于共享解码器中,从而有效解耦低层几何与高层语义。除重构目标外,我们还采用三种对齐目标来增强时序理解,包括帧级运动和视频级全局信息。我们展示,所训练的编码器甚至在无需进一步微调的情况下即可判别时空表征。基于 MSR-Action3D、NTU-RGBD、HOI4D、NvGesture 和 SHREC'17 的大量实验表明,我们方法在粗粒度和细粒度 4D 下游任务中均优于现有方法。值得注意的是,Uni4D 在 HOI4D 上的动作分割精度提升了 。
引用
@article{arxiv.2504.04837,
title = {Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos},
author = {Zhi Zuo and Chenyi Zhuang and Pan Gao and Jie Qin and Hao Feng and Nicu Sebe},
journal= {arXiv preprint arXiv:2504.04837},
year = {2025}
}
备注
11 pages, 7 figures