中文

先对齐后适应:4D感知参数高效迁移学习的重新思考

计算机视觉与模式识别 2026-04-29 v2

摘要

点云视频理解对于机器人来说至关重要,因为它准确地编码了运动和场景交互。我们认识到,4D数据远远稀缺于3D数据,这会阻碍自监督4D模型的可扩展性。一个有前景的替代方案是将3D预训练模型迁移到4D感知任务。然而,严格的经验分析揭示了两个关键限制,阻碍了迁移能力:过拟合和模态差距。为克服这些挑战,我们开发了一种新的"Align then Adapt"(PointATA)范式,将参数高效迁移学习分解为两个顺序阶段。我们采用最优传输理论来量化3D和4D数据集之间的分布差异,使我们提出的点对齐嵌入器能够在阶段1中进行训练,以缓解潜在的模态差距。为缓解过拟合,我们将一种高效的点-视频适配器和空间上下文编码器集成到冻结的3D主干网络中,以增强阶段2中的时序建模能力。值得注意的是,尽管有上述工程导向的设计,PointATA使得一个没有时序知识的预训练3D模型能够在较小的参数成本下推理动态视频内容。广泛的实验表明,PointATA能够匹配甚至超过强大的完全微调模型,同时享有参数高效的优势,例如在3D动作识别上达到97.21%的准确率,4D动作分割上提升8.7%,4D语义分割上达到84.06%。

关键词

引用

@article{arxiv.2602.23069,
  title  = {Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception},
  author = {Yiding Sun and Jihua Zhu and Haozhe Cheng and Chaoyi Lu and Zhichuan Yang and Lin Chen and Yaonan Wang},
  journal= {arXiv preprint arXiv:2602.23069},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Multimedia (Regular Paper)