WhatsAI:将 Meta Ray-Ban 变为面向无障碍的可扩展生成式 AI 平台
人机交互
2025-05-16 v1
摘要
多模态生成式 AI 模型集成到可穿戴设备中,已在增强先天或视力受损者(BVI)获取视觉信息方面展现出巨大潜力,Meta Ray-Ban 的快速普及即是一证。然而,这些平台的专有属性阻碍了视障残疾人主导的视觉可访问性技术创新。例如,OpenAI 在 2024 年展示了实时多模态 AI 作为可访问资源的潜力,但所呈现的应用仍未到达 BVI 用户的手中,尽管技术已自当时可用。为促进视觉访问技术开发的民主化,我们引入 WhatsAI,一个原型可扩展框架,使 BVI 爱好者能够利用 Meta Ray-Ban 创建个性化可穿戴视觉可访问性技术。我们的系统是首个提供完全可修改模板、集成 WhatsApp 的平台,促进无障碍人工智能实施(AAII),使盲人能够进行实时场景描述、物体检测和光学字符识别(OCR)等关键视觉辅助任务,运用标准机器学习技术和最前沿的视觉语言模型。我们框架的可扩展性愿景,旨在培育由 BVI 黑客和创新者领导的社区方法,以解决视觉可访问性所面临的复杂挑战。
关键词
引用
@article{arxiv.2505.09823,
title = {WhatsAI: Transforming Meta Ray-Bans into an Extensible Generative AI Platform for Accessibility},
author = {Nasif Zaman and Venkatesh Potluri and Brandon Biggs and James M. Coughlan},
journal= {arXiv preprint arXiv:2505.09823},
year = {2025}
}
备注
6 pages, 1 figure