Syn4D:一个多视角合成 4D 数据集
计算机视觉与模式识别
2026-05-07 v1 人工智能
机器学习
摘要
从单目视频中对动态场景进行稠密 3D 重建和跟踪仍是计算机视觉中的重要开放挑战。该领域的进展受限于稀缺的高质量数据集,这些数据集包含稠密、完整且准确的几何标注。为解决这一限制,我们引入 Syn4D,这是一个包含动态场景的多视角合成数据集,包括地面实况相机运动、深度图、稠密跟踪和参数化人体姿态标注。Syn4D 的一个关键特性是将任何像素反投影到任意时间和任意相机。我们在多个下游任务上进行了广泛的评估,以展示所提出数据集的实用性和有效性,包括 4D 场景重建、3D 点跟踪、几何感知相机重定向和人体姿态估计。实验结果突显了 Syn4D 在促进动态场景理解和时空建模研究方面的潜力。
引用
@article{arxiv.2605.05206,
title = {Taming Outlier Tokens in Diffusion Transformers},
author = {Xiaoyu Wu and Yifei Wang and Tsu-Jui Fu and Liang-Chieh Chen and Zhe Gan and Chen Wei},
journal= {arXiv preprint arXiv:2605.05206},
year = {2026}
}
备注
Under review