Sanvaad:面向手语识别与语音交互的多模态无障碍框架
计算机视觉与模式识别
2025-12-09 v1
摘要
聋人用户、视障用户与一般听人之间的交流往往依赖于仅支持单向交互的工具。为解决这一局限,本工作提出了 Sanvaad,一个轻量级多模态无障碍框架,旨在支持实时双向通信。对于聋人用户,Sanvaad 包含一个基于 MediaPipe 特征点构建的手语识别模块。MediaPipe 主要因其高效性和低计算负载而被选用,使系统无需专用硬件即可在边缘设备上流畅运行。手机语音输入也可通过语音到手语转换组件映射到预定义短语并生成相应的 GIF 或基于字母的可视化表示。对于视障用户,该框架提供了一个无屏幕语音界面,集成了多语言语音识别、文本摘要和文本转语音生成。这些组件通过基于 Streamlit 的界面协同工作,使系统可在桌面和移动环境中使用。总体而言,Sanvaad 旨在通过将轻量级计算机视觉和语音处理工具整合在一个统一框架中,为包容性交流提供实用且便捷的方式。
引用
@article{arxiv.2512.06485,
title = {Sanvaad: A Multimodal Accessibility Framework for ISL Recognition and Voice-Based Interaction},
author = {Kush Revankar and Shreyas Deshpande and Araham Sayeed and Ansh Tandale and Sarika Bobde},
journal= {arXiv preprint arXiv:2512.06485},
year = {2025}
}