中文

通过掩蔽声与增益联合选择实现自主原位声景增强

音频与语音处理 2022-08-31 v2 机器学习 声音

摘要

在声景增强系统中,掩蔽声(masker)与播放增益水平的选择对其改善给定环境整体声学舒适度的有效性至关重要。传统上,合适掩蔽声与增益水平的选择依赖于专家意见(可能不代表目标人群)或听音测试(耗时且费力)。此外,由此产生的掩蔽声与增益的静态选择常难以灵活适应真实世界声景的动态特性。本工作中,我们利用深度学习模型对给定声景的最优掩蔽声及其增益水平进行联合选择。所提模型采用高度模块化构建单元设计,支持优化的推理过程,可快速搜索大量掩蔽声与增益组合。此外,我们引入基于特征域、以数字增益水平为条件的声景增强,消除了推理时计算昂贵的波形域混合过程,以及新掩蔽声所需的繁琐预校准过程。所提系统在大规模增强声景主观响应数据集上得到验证,该数据集包含超过440名参与者,确保了模型预测掩蔽声及其增益水平对感知愉悦度的联合效应的能力。

关键词

引用

@article{arxiv.2204.13883,
  title  = {Autonomous In-Situ Soundscape Augmentation via Joint Selection of Masker and Gain},
  author = {Karn N. Watcharasupat and Kenneth Ooi and Bhan Lam and Trevor Wong and Zhen-Ting Ong and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2204.13883},
  year   = {2022}
}

备注

Accepted to IEEE Signal Processing Letters. (c) 2022 IEEE