利用深度学习与紧凑表示法从扫描头部几何预测全局头相关传输函数
音频与语音处理
2025-02-06 v2 声音
摘要
在日益增长的虚拟听觉显示领域,个性化头相关传输函数(HRTF)对于在混合现实与增强现实应用中建立准确的声音图像起着至关重要的作用。本工作中,我们提出一种采用卷积神经网络(CNN)的HRTF个性化方法,从受试者的扫描头部几何预测其所有方向的HRTF。为简化CNN模型的训练,我们提出针对头部扫描与HRTF数据的新颖预处理方法以获得紧凑表示。对于头部扫描,我们使用截断球冠调和(SCH)系数表示耳廓区域,该区域在声散射过程中十分重要。对于HRTF数据,我们使用截断球谐(SH)系数表示HRTF幅度与起音。一个CNN模型被训练用于从扫描耳部几何的SCH系数及头部其他人体测量数据预测HRTF幅度的SH系数。另一个CNN模型被训练用于仅从耳、头、躯干的体测量数据预测HRTF起音的SH系数。结合幅度与起音预测,我们的方法能够预测完整且全局的HRTF数据。采用留一验证与对数谱失真(LSD)度量进行客观评价。结果显示,与真值HRTF相比,在空间与时间维度均达到尚可的LSD水平,且低于数据库所提供的HRTF边界元法(BEM)仿真结果的LSD。基于听觉模型的定位仿真结果也与客观评价指标一致,表明使用我们所预测HRTF的定位响应显著优于BEM计算所得。
引用
@article{arxiv.2207.14352,
title = {Predicting Global HRTFs From Scanned Head Geometry Using Deep Learning and Compact Representations},
author = {Yuxiang Wang and You Zhang and Zhiyao Duan and Mark Bocko},
journal= {arXiv preprint arXiv:2207.14352},
year = {2025}
}
备注
10 pages, 13 figures