TS-RGBD 数据集:面向视障人士剧场场景描述的新数据集
计算机视觉与模式识别
2023-08-03 v1
摘要
计算机视觉长期作为辅助视障人士在其环境中移动并避开障碍与跌倒的工具。现有方案局限于室内或室外场景,这限制了视障人士可处的场所与场景类型,包括诸如剧场之类的娱乐场所。此外,多数所提出的基于计算机视觉的方法依赖 RGB 基准来训练模型,因缺乏深度模态而导致性能有限。本文提出一个包含剧场场景的新型 RGB-D 数据集,带有用于图像描述与人动作识别的真实人动作与密集字幕标注:TS-RGBD 数据集。其包含三类数据:由 Microsoft Kinect 采集的 RGB、深度与骨骼序列。我们在该数据集上测试图像描述模型及若干基于骨骼的人动作识别模型,以期通过检测人动作并以文本描述剧场场景中感兴趣区域的外观,拓展视障人士可处环境之类型。
引用
@article{arxiv.2308.01035,
title = {TS-RGBD Dataset: a Novel Dataset for Theatre Scenes Description for People with Visual Impairments},
author = {Leyla Benhamida and Khadidja Delloul and Slimane Larabi},
journal= {arXiv preprint arXiv:2308.01035},
year = {2023}
}