中文

基于视觉与参与者关联输入多模态融合的自主声景增强

声音 2024-07-03 v2 音频与语音处理

摘要

自主声景增强系统通常使用训练好的模型挑选最优掩蔽声以实现期望的感知变化。尽管声学信息对此类系统至关重要,上下文信息(包括参与者人口统计特征与视觉环境)同样影响声学感知。因此,我们对现有的基于注意力的深度神经网络提出模块化修改,以实现参与者关联、视觉与声学特征的早期、中级与晚期特征融合。使用 ARAUS 数据集对模块配置及相应融合方法进行的消融研究表明,上下文特征以统计显著方式提升了模型在归一化 ISO 愉悦度上的表现,最佳全模态模型的均方误差为 0.1194±0.00120.1194\pm0.0012,而仅音频模型为 0.1217±0.00090.1217\pm0.0009。声景增强系统由此可利用多模态输入提升性能。我们还利用训练好的模型考察个体参与者关联因素的影响,以说明模型可解释性的提升。

关键词

引用

@article{arxiv.2303.08342,
  title  = {Autonomous Soundscape Augmentation with Multimodal Fusion of Visual and Participant-linked Inputs},
  author = {Kenneth Ooi and Karn N. Watcharasupat and Bhan Lam and Zhen-Ting Ong and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2303.08342},
  year   = {2024}
}

备注

[v1] 5 pages, 2 figures. Submitted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing. [v2] 5 pages, 2 figures. Fixed incorrect author list in citation #30