SonicSieve:基于声学微结构将定向语音提取带到智能手机
声音
2026-02-13 v3 人机交互
机器学习
音频与语音处理
摘要
想象将您的智能手机放在嘈杂的餐厅桌上,清晰地捕捞围绕您的朋友的语音,或在回声厅的讲堂里清晰地录制讲者的语音。我们介绍SonicSieve,这是首个用于智能手机的智能定向语音提取系统,采用仿生声学微结构。我们的被动设计将定向线索嵌入进入的语音信号,而无需额外电子设备。它可附加在低成本有线耳机的内置麦克风上,从而可附加到智能手机上。我们呈现了一个在移动设备上实时处理原始音频混合信号的端到端神经网络。我们的实验结果表明,SonicSieve在聚焦30度角区域时实现了5.0 dB的信号质量提升。此外,仅用两个麦克风的系统性能优于传统的5麦克风阵列。
引用
@article{arxiv.2504.10793,
title = {SonicSieve: Bringing Directional Speech Extraction to Smartphones Using Acoustic Microstructures},
author = {Kuang Yuan and Yifeng Wang and Xiyuxing Zhang and Chengyi Shen and Swarun Kumar and Justin Chan},
journal= {arXiv preprint arXiv:2504.10793},
year = {2026}
}