精细化声景控制:增强听觉
声音
2026-03-06 v2 机器学习
音频与语音处理
摘要
可穿戴设备日益普及,但其声音控制仍粗糙:用户要么启用全局噪声抑制,要么专注于单个目标声。然而,现实的声学场景包含许多同时出现的声源,用户可能希望独立调整每个声源。我们引入Aurchestra,首个在资源受限的可穿戴设备上提供细粒度、实时声景控制的系统。该系统包含两个关键组件:(1)动态界面仅显示活跃的声源类别;(2)实时、基于设备的多输出提取网络,为每个选定类别生成独立的音频流,实现对最多5个重叠目标声源的鲁棒性能,使用户能够通过自定义每个类别的音量来混合环境,类似于音频工程师混合轨道。我们针对多个计算受限平台优化模型架构,演示在6 ms流式音频块上的实时性能。在此前未见的室内外真实环境中,该系统实现了表达式化的类别级声音控制,并在目标类别增强和干扰抑制方面实现了显著提升。我们的结果表明,世界不必以单一、无差异的流形式呈现:借助Aurchestra,声景才真正变得可编程。
引用
@article{arxiv.2603.00395,
title = {Fine-grained Soundscape Control for Augmented Hearing},
author = {Seunghyun Oh and Malek Itani and Aseem Gauri and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2603.00395},
year = {2026}
}
备注
15 pages, 11 figures, 4 tables, submitted to ACM MobiSys 2026