使用双耳空间自适应神经网络(BSANN)的个人声区立体声渲染
音频与语音处理
2026-01-13 v1 声音
摘要
提出了一种用于个人声区(PSZ)的双耳渲染框架,使多个头部跟踪的听者能够接收完全独立的立体声音频节目。当前的PSZ系统通常依赖单声道渲染,因此无法分别控制左右耳,这限制了空间成像的质量和准确性。所提出的方法采用双耳空间自适应神经网络(BSANN)生成耳优化的扬声器滤波器,在多个听者的每只耳朵处重建所需的声场。该框架集成了消声测量的扬声器频率响应、解析建模的换能器指向性和刚性球头相关传递函数(HRTF),以增强声学精度和空间渲染保真度。一个显式的主动串扰消除(XTC)阶段进一步改善了三维空间感知。实验表明,在测量的客观性能指标上取得了显著提升,包括区间隔离度(IZI)、节目间隔离度(IPI)和串扰消除(XTC),在100-20,000 Hz范围内,对数频率加权值分别为10.23/10.03 dB(IZI)、11.11/9.16 dB(IPI)和10.55/11.13 dB(XTC)。耳级控制、精确声学建模和集成主动XTC的结合产生了一种统一的渲染方法,在真实声学环境中提供了更大的隔离性能、对房间不对称性的增强鲁棒性以及更忠实的空间再现。
引用
@article{arxiv.2601.06621,
title = {Stereo Audio Rendering for Personal Sound Zones Using a Binaural Spatially Adaptive Neural Network (BSANN)},
author = {Hao Jiang and Edgar Choueiri},
journal= {arXiv preprint arXiv:2601.06621},
year = {2026}
}
备注
Submitted to IEEE Transactions on Audio, Speech, and Language Processing (TASLP)