L4P:统一低层 4D 视觉感知
计算机视觉与模式识别
2025-10-03 v3
摘要
视频像素之间的时空关系对于低层 4D 感知任务至关重要。应该能够解决多个此类任务的单一模型。然而,大多数最先进的方法依赖于针对特定任务优化的体系结构。我们提出 L4P,一个前馈、通用架构,用于统一框架中的低层 4D 感知任务。L4P 利用预训练的基于 ViT 的视频编码器,并将其与轻量级、因此无需大量训练的 per-task heads 结合。尽管其通用且前馈的表述,本方法在密集任务(如深度或光流估计)和稀疏任务(如 2D/3D 跟踪)方面均与现有专用方法相当。此外,它能够在与单任务方法相当的时间内一次性解决所有任务。
引用
@article{arxiv.2502.13078,
title = {L4P: Towards Unified Low-Level 4D Vision Perception},
author = {Abhishek Badki and Hang Su and Bowen Wen and Orazio Gallo},
journal= {arXiv preprint arXiv:2502.13078},
year = {2025}
}