EchoVest:通过经皮电神经刺激表达的实时声音分类与深度感知
声音
2023-07-11 v1 机器学习
音频与语音处理
信号处理
摘要
全球超过 15 亿人患有听力障碍。尽管已为这类残障人士创造了多种技术,但其中大多数要么极其昂贵,要么在中低收入国家难以日常使用。为应对此问题,我们开发了一款新型辅助设备 EchoVest,帮助盲聋人群更直观地感知环境。EchoVest 基于声源利用经皮电神经刺激(TENS)向用户身体传递振动。EchoVest 还提供多种功能,包括声源定位、声音分类、降噪与深度感知。我们旨在准确率与计算成本上超越基于 CNN 的机器学习模型——最常用的分类任务机器学习模型。为此,我们开发并采用了一种新颖音频流水线,将 Audio Spectrogram Transformer(AST)模型(一种基于注意力的模型)用于声音分类,并使用快速傅里叶变换进行降噪。Otsu 方法的应用帮助我们找到了背景噪声过滤的最优阈值,并大幅提升了准确率。为精确计算方向与深度,我们应用了复时延差(Complex Time Difference of Arrival)算法与 SOTA 定位。我们最后的改进是使用盲源分离使算法适用于多麦克风输入。最终算法在多个检查点上取得最先进结果,包括在 ESC-50 环境声音分类数据集上 95.7% 的准确率。
引用
@article{arxiv.2307.04604,
title = {EchoVest: Real-Time Sound Classification and Depth Perception Expressed through Transcutaneous Electrical Nerve Stimulation},
author = {Jesse Choe and Siddhant Sood and Ryan Park},
journal= {arXiv preprint arXiv:2307.04604},
year = {2023}
}