中文

CASTLE 2024 数据集:多模态理解时代的进步

多媒体 2026-01-16 v1 人工智能 计算机视觉与模式识别 信息检索

摘要

客观视频近年来受到广泛关注,因为其在多个领域具有应用价值。然而,大多数现有数据集仅包含单一视角。本文提出了 CASTLE 2024 数据集,是一个包含第一人称视角和第三人称视角(即 ego- 和 exo-centric)视频和音频的多模态集合,包含 15 个时间对齐的源,以及其他传感器流和辅助数据。该数据集由志愿者在固定位置持续四天记录获得,包括 10 名参与者的视角,外加 5 个固定摄像机提供外观视角。整个数据集包含超过 600 小时的 UHD 视频,录制速度为 50 帧/秒。与其他数据集不同,CASTLE 2024 不包含任何部分隐私保护内容,如模糊化人脸或失真音频。该数据集可通过 https://castle-dataset.github.io/ 访问。

关键词

引用

@article{arxiv.2503.17116,
  title  = {The CASTLE 2024 Dataset: Advancing the Art of Multimodal Understanding},
  author = {Luca Rossetto and Werner Bailer and Duc-Tien Dang-Nguyen and Graham Healy and Björn Þór Jónsson and Onanong Kongmeesub and Hoang-Bao Le and Stevan Rudinac and Klaus Schöffmann and Florian Spiess and Allie Tran and Minh-Triet Tran and Quang-Linh Tran and Cathal Gurrin},
  journal= {arXiv preprint arXiv:2503.17116},
  year   = {2026}
}

备注

7 pages, 6 figures, dataset available via https://castle-dataset.github.io/