4D-RGPT:通过感知蒸馏实现区域级别的4D理解
计算机视觉与模式识别
2026-04-14 v4
摘要
尽管多模态大语言模型 (MLLM) 在进步,但其在3D结构和时序动态推理方面的能力仍受限,这受限于弱4D 感知和时序理解。现有的3D和4D视频问答 (VQA) 基准也强调静态场景,缺乏区域级别的提示。我们通过引入:(a) 4D-RGPT,一种专为捕获视频输入的4D表示而设计的 specialized MLLM,以增强时序感知;(b) 感知4D蒸馏 (P4D),一种将4D表示从冻结专家模型蒸馏到4D-RGPT以实现全面4D感知的训练框架;(c) R4D-Bench,一个基于混合自动化和人工验证管道构建的深度感知动态场景带区域级别提示的基准。我们的方法在两个现有4D VQA 基准以及我们提出的R4D-Bench 基准上均取得显著改进。
引用
@article{arxiv.2512.17012,
title = {4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation},
author = {Chiao-An Yang and Ryo Hachiuma and Sifei Liu and Subhashree Radhakrishnan and Raymond A. Yeh and Yu-Chiang Frank Wang and Min-Hung Chen},
journal= {arXiv preprint arXiv:2512.17012},
year = {2026}
}
备注
CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench