SANPO:一个面向场景理解、无障碍与人体导航的数据集
计算机视觉与模式识别
2024-12-23 v2
摘要
视觉对于人类导航至关重要。世界卫生组织(WHO)估计,2020年有4330万人失明,预计到2050年这一数字将达到6100万。现代场景理解模型可通过辅助导航、避障和视觉识别能力赋能这些人群。研究界需要高质量的数据集用于训练和评估以构建这些系统。尽管自动驾驶车辆的数据集十分丰富,但专为室外人体导航定制的数据集存在关键缺口。这一缺口对基于计算机视觉的辅助技术的发展构成了主要障碍。为克服该障碍,我们提出了SANPO,一个大规模第一视角视频数据集,专为室外人体导航环境中的密集预测设计。SANPO包含701段30秒以上的立体视频,拍摄于美国四个地理位置多样的实时室外环境。每一帧均具有高分辨率深度图,其中112K帧标注了时间一致的密集视频全景分割标签。该数据集还包括1961段高质量合成视频,具有像素级精确的深度和全景分割标注,以用高精度合成标注平衡带噪声的真实世界标注。SANPO已公开可用,并被Project Guideline等移动应用用于训练移动模型,帮助低视力用户独立在室外跑步。为在同行评审期间保持匿名,我们将在录用后提供数据集链接。SANPO可在此获取:https://google-research-datasets.github.io/sanpo_dataset/
引用
@article{arxiv.2309.12172,
title = {SANPO: A Scene Understanding, Accessibility and Human Navigation Dataset},
author = {Sagar M. Waghmare and Kimberly Wilber and Dave Hawkey and Xuan Yang and Matthew Wilson and Stephanie Debats and Cattalyya Nuengsigkapian and Astuti Sharma and Lars Pandikow and Huisheng Wang and Hartwig Adam and Mikhail Sirotenko},
journal= {arXiv preprint arXiv:2309.12172},
year = {2024}
}
备注
WACV2025 submission version. 8 pages, plus supplementary material