ViT Cane:面向视障人士的视觉辅助手杖
计算机视觉与模式识别
2021-09-29 v1 人工智能
摘要
盲人和视障人士在独立出行时面临诸多问题。其中一些挑战包括寻找到达目的地的最短路径以及远距离检测障碍物。为了解决这个问题,本文提出了 ViT Cane,它利用视觉 Transformer 模型实时检测障碍物。我们的整个系统由 Pi Camera Module v2、配备 8GB 内存的 Raspberry Pi 4B 和 4 个电机组成。基于使用 4 个电机的触觉输入,该障碍物检测模型在帮助视障人士探索未知地形方面非常高效,且设计易于复现。本文讨论了在此特定应用中 Visual Transformer 模型与其他基于 CNN 的模型的实用性比较。通过严格的测试,所提出的障碍物检测模型在 Common Object in Context (COCO) 数据集上取得了比其对应的 CNN 模型更高的性能。进行了全面的实地测试,以验证我们的系统在整体室内理解和避障方面的有效性。
引用
@article{arxiv.2109.13857,
title = {ViT Cane: Visual Assistant for the Visually Impaired},
author = {Bhavesh Kumar},
journal= {arXiv preprint arXiv:2109.13857},
year = {2021}
}
备注
4 pages, 4 figures