面向本地语音与视觉推断的隐私保护多模态可穿戴设备开发经验教训
人机交互
2025-11-26 v2 系统与控制
音频与语音处理
图像与视频处理
系统与控制
摘要
许多具有前景的多模态可穿戴设备应用需要持续感知和重计算,但由于隐私顾虑,用户会拒绝此类设备。本文分享了我们构建的戴耳式语音与视觉可穿戴设备的经验,该设备使用配对智能手机作为受信任个人边缘设备进行本地 AI 推断。我们描述了此隐私保护系统的硬件-软件协同设计,包括在 30 克重量内集成摄像头、麦克风和扬声器的挑战、实现唤醒词触发式数据捕获,以及在离线模式下运行量化后的视觉-语言和大型语言模型。通过反复原型制作,我们确定了电源预算、连接性、延迟和社会可接受性等关键设计瓶颈。我们的初始评估表明,基于通用移动硬件即可在交互式延迟下实现完全本地多模态推断。我们以构建嵌入式 AI 系统的设计经验教训结束,旨在在日常环境中平衡隐私、响应性和可用性。
引用
@article{arxiv.2511.11811,
title = {Lessons Learned from Developing a Privacy-Preserving Multimodal Wearable for Local Voice-and-Vision Inference},
author = {Yonatan Tussa and Andy Heredia and Nirupam Roy},
journal= {arXiv preprint arXiv:2511.11811},
year = {2025}
}