mmWalk:面向多模态多视角的步行辅助
计算机视觉与模式识别
2025-10-24 v2
摘要
在极端或复杂环境中,对于失明或视力受限者的步行辅助仍是一个重大挑战,主要由于缺乏整体的场景理解。为了满足视力受限社区的真实需求,我们构建 mmWalk,一个集成多视角传感器和以可访问性为导向的特征的模拟多模态数据集,用于户外安全导航。该数据集包含 120 个手动控制的、场景分类的步行轨迹,包含 62k 个同步帧。它包含超过 559k 个跨 RGB、深度和语义模态的全景图像。此外,为了强调现实相关性,每个轨迹都涉及户外角落情况和针对视力受限用户的可访问性特定地标。我们还生成 mmWalkVQA,一个包含 69k 条跨 9 个类别的视觉问答三元组的 VQA 数据集,专为安全且有信息的步行辅助而设计。我们对最新视觉语言模型 (VLMs) 使用零-shot 和 few-shot 设置进行评估,发现它们在我们的风险评估和导航任务中表现不佳。我们在真实数据集上验证了 mmWalk 微调模型的结果,显示该数据集对于推动多模态步行辅助具有有效性。
引用
@article{arxiv.2510.11520,
title = {mmWalk: Towards Multi-modal Multi-view Walking Assistance},
author = {Kedi Ying and Ruiping Liu and Chongyan Chen and Mingzhe Tao and Hao Shi and Kailun Yang and Jiaming Zhang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2510.11520},
year = {2025}
}
备注
Accepted by NeurIPS 2025 Datasets and Benchmarks Track. Data and Code: https://github.com/KediYing/mmWalk