中文

Audo-Sight:为盲人和视力受损者启用环境交互

人机交互 2025-05-02 v1 分布式、并行与集群计算

摘要

视力受损者在尝试与复杂环境交互与理解方面面临诸多挑战,传统辅助技术往往难以快速提供必要的上下文理解与交互智能。本论文提出 Audo-Sight,一种前沿辅助系统,无缝集成多模态大型语言模型(MLLM),为盲人和视力受损者(BVI)提供快速、情境感知的交互。系统以两种不同模式运行:面向个体用户的定制化交互(通过用户识别)以及在博物馆、购物中心等公共空间的共享访问。在定制环境中,系统根据个体用户偏好调整输出,从而通过用户感知形式的交互提升可访问性。在共享环境中,Audo-Sight 采用共享架构,能适应当前使用者,无需手动重新配置。为便于与 LLM 进行适当交互,公共版 Audo-Sight 包含年龄范围判断器和安全查询过滤器。此外,系统通过 NeMo Guardrails 确保回复对 BVI 用户友好。通过多模态推理、BVI 认知响应编辑及安全保护功能,本工作代表了一项在 AI 驱动的可访问性技术领域的重大突破,能够提升视力受损者在社交场景中的自主性、安全性与交互能力。最后,我们展示了 Audo-Sight 与 SmartSight 的集成,使其为 BVI 人员提供增强的情境意识。该集成利用 SmartSight 的实时视觉分析,结合 Audo-Sight 的广泛推理与交互能力,超越简单对象识别,提供基于情境的、语音控制的动态环境帮助。

关键词

引用

@article{arxiv.2505.00153,
  title  = {Audo-Sight: Enabling Ambient Interaction For Blind And Visually Impaired Individuals},
  author = {Bhanuja Ainary},
  journal= {arXiv preprint arXiv:2505.00153},
  year   = {2025}
}

备注

This thesis was conducted under the guidance of Mohsen Amini Salehi. Special thanks to Minseo Kim and Jacob Bradshaw for their valuable contributions and support throughout the research process. 60 pages, 13 Figures, 2 Tables