中文

EgoBlind: 面向盲人自我中心视觉辅助

计算机视觉与模式识别 2025-11-04 v4 人工智能 多媒体

摘要

我们提出了 EgoBlind,这是首个从盲人个体收集的自我中心视频问答(VideoQA)数据集,用于评估当代多模态大语言模型(MLLMs)的辅助能力。EgoBlind 包含来自盲人和视障人士日常生活的 1,392 个第一人称视频。它还包含 5,311 个由盲人直接提出或验证的问题,以反映他们在实际情境中对视觉辅助的需求。每个问题平均有 3 个手动标注的参考答案,以减少主观性。利用 EgoBlind,我们全面评估了 16 个先进的 MLLM,发现所有模型均表现不佳。表现最好的模型准确率达到约 60%,远低于人类表现的 87.4%。为指导未来进展,我们识别并总结了现有 MLLM 在盲人自我中心视觉辅助方面的主要局限,并探索了改进的启发式方法。通过这些努力,我们希望 EgoBlind 能成为开发有效 AI 助手以提升盲人和视障人士独立性的基础。数据和代码可在 https://github.com/doc-doc/EgoBlind 获取。

关键词

引用

@article{arxiv.2503.08221,
  title  = {EgoBlind: Towards Egocentric Visual Assistance for the Blind},
  author = {Junbin Xiao and Nanxin Huang and Hao Qiu and Zhulin Tao and Xun Yang and Richang Hong and Meng Wang and Angela Yao},
  journal= {arXiv preprint arXiv:2503.08221},
  year   = {2025}
}

备注

NeurIPS'25 (D&B Track)