物理声学建模对神经网络个人声区渲染影响的分解:一种消除法研究
音频与语音处理
2026-03-04 v1 声音
信号处理
摘要
深度学习的个人声区(PSZ)依赖于用于训练的模拟声学传递函数(ATF),而理想的点源模型与现实之间的仿真-实际鸿沟较大。虽然物理信息化组件可提升泛化能力,但各个贡献仍不明确。本文提出了一种针对头部姿态条件化的双耳个人声区渲染器的受控消除实验,基于 Binaural Spatial Audio Neural Network(BSANN)。我们逐步丰富模拟 ATF,包含三个组成部分:(i)特定音箱的无声学测量频率响应(FR),(ii)解析圆盘活塞定向(DIR),以及(iii)刚性球体人类先天传递函数(RS-HRTF)。评估四种配置,通过两个虚拟头的现场测量。性能指标包括 100-20000 Hz 范围内的区域隔离(IZI)、程序干扰(IPI)和串扭消除(XTC)。结果表明,FR 提供频谱校准,带来适度的 XTC 改进并降低区域间听者 IPI 不平衡;DIR 实现最一致的声区分离提升(平均 IZI/IPI 提升 10.05 dB);RS-HRTF 在双耳分离方面占主导地位,将 XTC 提升至平均 4.51 dB 至 7.91 dB(+2.38/+2.89 dB),主要集中在 2 kHz 以上,同时引入轻微的听者依赖性 IZI/IPI 偏移。这一发现指导了在预算有限时构建训练 ATF时的测量与模型优先级。
引用
@article{arxiv.2603.02508,
title = {Decomposing the Influence of Physical Acoustic Modeling on Neural Personal Sound Zone Rendering: An Ablation Study},
author = {Hao Jiang and Edgar Choueiri},
journal= {arXiv preprint arXiv:2603.02508},
year = {2026}
}