用于设备上定向听觉的混合神经网络
声音
2021-12-14 v1 机器学习
音频与语音处理
摘要
设备上定向听觉要求从给定方向分离音频源,同时满足严格的人耳不可感知时延要求。尽管神经网络可比传统波束成形器取得显著更优的性能,但现有模型均无法支持计算受限可穿戴设备上的低时延因果推理。我们提出DeepBeam,一种将传统波束成形器与定制轻量神经网络结合的混合模型。前者降低了后者的计算负担并提升其泛化性,而后者旨在进一步减少内存与计算开销以实现实时低时延操作。我们的评估显示,在合成数据上其性能可与SOTA因果推理模型媲美,同时模型尺寸减小5倍、每秒计算量减小4倍、处理时间缩短5倍,并对真实硬件数据泛化更好。此外,我们的实时混合模型在面向低功耗可穿戴设备的移动CPU上以8 ms运行,并实现17.5 ms的端到端时延。
引用
@article{arxiv.2112.05893,
title = {Hybrid Neural Networks for On-device Directional Hearing},
author = {Anran Wang and Maruchi Kim and Hao Zhang and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2112.05893},
year = {2021}
}