360+x:全景多模态场景理解数据集
计算机视觉与模式识别
2024-04-09 v2 人工智能
多媒体
声音
音频与语音处理
摘要
人类对世界的感知由众多视点和模态塑造。虽然许多现有数据集侧重于从特定视角(例如第一人称或第三人称视角)进行场景理解,但我们的数据集提供了全景视角(即多视点与多数据模态)。具体而言,我们在每个捕获的场景中包含了第三人称全景和前视图,以及第一人称单目/双目视图,其丰富模态包括视频、多通道音频、定向双耳延迟、位置数据和文本场景描述,呈现了对世界的全面观察。图 1 展示了我们 360+x 数据集所有 28 个场景类别的一瞥。据我们所知,这是第一个涵盖多视点与多数据模态的数据库,旨在模拟现实世界中日常信息的获取方式。通过我们的基准分析,我们在提出的 360+x 数据集上展示了 5 个不同的场景理解任务,以评估每种数据模态和视角在全景场景理解中的影响和益处。我们希望这一独特数据集能拓宽全面场景理解的范围,并鼓励社区从更多样化的视角来解决这些问题。
引用
@article{arxiv.2404.00989,
title = {360+x: A Panoptic Multi-modal Scene Understanding Dataset},
author = {Hao Chen and Yuqi Hou and Chenyuan Qu and Irene Testini and Xiaohan Hong and Jianbo Jiao},
journal= {arXiv preprint arXiv:2404.00989},
year = {2024}
}
备注
CVPR 2024 (Oral Presentation), Project page: https://x360dataset.github.io/