面向听障人群的AI导诊助理设备开发
机器学习
2025-07-22 v1 声音
音频与语音处理
摘要
本研究旨在开发一个面向听障或听力受损人群的深度学习系统。该设备将实时准确定位和识别声源。本研究通过机器学习技术针对弱势群体开发此类系统,填补当前研究中的重要空白。系统包含三个主要组件:1. JerryNet:一种定制设计的CNN架构,用于确定九个可能方向的来向方向(DoA)。2. 音频分类:该模型基于对比语言-音频预训练(CLAP)模型进行微调,仅基于音频识别具体声类。3. 多模态集成模型:这是一个精确的声源定位模型,结合音频、视觉和文本数据在图像中定位确切声源。该部分包含两个模块:一个使用Yolov9进行对象检测生成所有边界框,以及一个音频-视觉定位模型用于识别使用完整交并比(CIoU)的 optimal 边界框。硬件包括四麦克风矩形阵列和安装在眼镜上的摄像头,外加手腕带用于显示必要信息如方向。在自定义数据集上,JerryNet实现了91.1%的声源方向精确率,超越所有基准模型。CLAP模型在自定义数据集和AudioSet数据集上分别达到98.5%和95%的准确率。声音-视觉定位模型在组件3中实现CIoU为0.892和AUC为0.658,超越其他类似模型。本研究具有众多潜在前景,为创建下一代无障碍设备铺平了道路。
引用
@article{arxiv.2507.14215,
title = {Developing an AI-Guided Assistant Device for the Deaf and Hearing Impaired},
author = {Jiayu and Liu},
journal= {arXiv preprint arXiv:2507.14215},
year = {2025}
}