中文

GuideDog:面向盲人和低视力人群的无障碍感知引导的真实世界体外多模态数据集

计算机视觉与模式识别 2026-05-01 v2

摘要

对于受视力受损及失明影响的人群来说,安全且独立的导航仍然是面临的主要挑战,影响全球超过 22 亿人士。尽管多模态大语言模型(MLLM)为辅助导航提供了新的机遇,但由于缺乏面向无障碍感知的数据集,进展受限。制作此类数据集需要耗费大量人力进行专家标注。为此,我们引入 GuideDog 数据集,包含 22000 组图像-描述配对(其中 2000 组经人工验证),覆盖 46 个国家的真实世界行人场景。我们的模型将标注从生成阶段转向验证阶段,基于专家及研究中的 established BLV guidance 标准,既提升了可扩展性,又保持了质量。我们还推出 GuideDogQA 数据集,包含 818 份样本,用于评估物体识别和深度感知能力。实验表明,深度感知能力及遵循这些标准的能力仍是当前 MLLM 挑战的重点。

关键词

引用

@article{arxiv.2503.12844,
  title  = {GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance},
  author = {Junhyeok Kim and Jaewoo Park and Junhee Park and Sangeyl Lee and Jiwan Chung and Jisung Kim and Ji Hoon Joung and Youngjae Yu},
  journal= {arXiv preprint arXiv:2503.12844},
  year   = {2026}
}

备注

ACL 2026 Main. Project page: https://jun297.github.io/GuideDog/