中文

SANN-PSZ: 用于头部追踪个人声区的空间自适应神经网络

音频与语音处理 2024-11-04 v1

摘要

提出了一种利用空间自适应神经网络(SANN)的深度学习框架,用于动态渲染带头部追踪的个人声区(PSZ),该网络输入听者头部坐标并输出 PSZ 滤波器系数。SANN 模型使用模拟声学传递函数(ATF)结合数据增强进行训练,以在不确定环境中获得鲁棒性,或使用模拟与实测 ATF 的混合进行训练,以在已知条件下进行定制。研究发现,在训练数据中增强房间反射比增强系统缺陷更能有效提高模型的鲁棒性,且向损失函数添加滤波器紧凑性等约束不会显著影响模型性能。将表现最佳的模型与传统滤波器设计方法进行比较表明,在没有实测 ATF 的情况下,该模型在实际房间环境中以更少的滤波器伪影实现了同等或更高的隔离度。此外,该模型相比传统方法实现了显著的数据压缩(100 倍)和计算效率(10 倍),使其适用于适应听者头部运动的 PSZ 实时渲染。

关键词

引用

@article{arxiv.2411.00772,
  title  = {SANN-PSZ: Spatially Adaptive Neural Network for Head-Tracked Personal Sound Zones},
  author = {Yue Qiao and Edgar Choueiri},
  journal= {arXiv preprint arXiv:2411.00772},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication