AMAVA:面向视力受损者的自适应运动感知视频到音频框架
计算机视觉与模式识别
2026-04-28 v1
摘要
视觉受损者的导航辅助工具在传递动态真实环境方面存在挑战,导致持续且非差异化反馈的认知过载。我们提出AMAVA,一种新型实时视频到音频框架,将移动设备视频转换为上下文相关的声音效果或文本语音描述。我们提出一种运动感知管线,使用轻量级AI分类模型区分低和高运动场景,随后采用实时文本到音频合成管线以更高效地增强环境感知。在静态环境中,AMAVA生成 spoken audio场景描述以实现情境意识。在高运动情境中,它优先处理安全,通过提供spoken危险警报和环境声效等声音线索。这些音频输出由基于mixture-of-experts和跨模态注意力的解码器-only transformer-based视觉语言模型产生,配合神经文本到语音和自然声合成网络。该框架使用基于提示的缓存和类别特定的节流,以避免听觉杂乱并最小化延迟。我们对系统进行了全面评估,包括一项将白杖单独使用与结合AMAVA进行的实时导航研究,结果显示用户信心和感知安全性显著提升。
引用
@article{arxiv.2604.23909,
title = {AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance},
author = {Benjamin Klein and Kazi Ruslan Rahman and Sanchita Ghose},
journal= {arXiv preprint arXiv:2604.23909},
year = {2026}
}
备注
8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289