VG4D:视觉语言模型走向4D视频识别
计算机视觉与模式识别
2024-04-18 v1 人工智能
机器人学
摘要
通过点云视频理解现实世界是机器人和自动驾驶系统的关键方面。然而,现有的4D点云识别方法由于传感器分辨率的限制,导致缺乏细致信息。最近的进展表明,预训练于大规模文本-图像数据集的视觉语言模型(VLM)可以学习细粒度的视觉概念,并可转移到各种下游任务。然而,有效地将VLM集成到4D点云领域仍是一个未解决的问题。本文提出了视觉语言模型走向4D(VG4D)框架,将VLM知识从视觉-文本预训练模型转移到4D点云网络。我们的做法涉及将4D编码器的表示与VLM对齐,以从大规模图像-文本对训练中学习共享的视觉和文本空间。通过将VLM知识转移到4D编码器并结合VLM,我们的VG4D实现了改进的识别性能。为了增强4D编码器,我们现代化了经典的动态点云骨架,并提出了改进版的PSTNet,即im-PSTNet,该方法能够有效地建模点云视频。实验表明,我们的方法在NTU RGB+D 60数据集和NTU RGB+D 120数据集上实现了最先进的动作识别性能。代码可在 \url{https://github.com/Shark0-0/VG4D} 获取。
引用
@article{arxiv.2404.11605,
title = {VG4D: Vision-Language Model Goes 4D Video Recognition},
author = {Zhichao Deng and Xiangtai Li and Xia Li and Yunhai Tong and Shen Zhao and Mengyuan Liu},
journal= {arXiv preprint arXiv:2404.11605},
year = {2024}
}
备注
ICRA 2024