中文

基于AI的声景分析:联合识别声源与预测烦扰度

音频与语音处理 2023-11-16 v1 声音

摘要

声景研究通常试图通过调查用户来捕捉对声音环境的感知与理解。然而,对于长期监测或干预评估,需要基于声音信号的方法。为此,以往多数研究聚焦于心理声学量或自动声音识别。很少尝试纳入评价(例如环形框架中的评价)。本文提出一种基于人工智能(AI)的双分支卷积神经网络与基于交叉注意力融合(DCNN-CaF)的方法,用于分析自动声景表征,包括声音识别与评价。利用包含人工标注声源标签与感知烦扰度的DeLTA数据集,提出DCNN-CaF以执行声源分类(SSC)与人感知烦扰度评分预测(ARP)。实验发现:(1)所提使用响度与梅尔特征的DCNN-CaF优于仅使用其中之一特征的DCNN-CaF;(2)所提带交叉注意力融合的DCNN-CaF在SSC与ARP任务上优于其他典型AI模型与声景相关传统机器学习方法;(3)相关性分析揭示,声源与烦扰度之间的关系在人类与所提AI模型DCNN-CaF之间相似;(4)泛化测试表明,在模型未知声源存在时,所提模型的ARP与专家预期一致,并能解释文献中先前关于声景增强的发现。

关键词

引用

@article{arxiv.2311.09030,
  title  = {AI-based soundscape analysis: Jointly identifying sound sources and predicting annoyance},
  author = {Yuanbo Hou and Qiaoqiao Ren and Huizhong Zhang and Andrew Mitchell and Francesco Aletta and Jian Kang and Dick Botteldooren},
  journal= {arXiv preprint arXiv:2311.09030},
  year   = {2023}
}

备注

The Journal of the Acoustical Society of America, 154 (5), 3145