中文

使用生成对抗网络与球心等角投影进行HRTF上采样

音频与语音处理 2024-02-28 v2 计算机视觉与模式识别 人机交互 机器学习 声音 信号处理

摘要

个性化头部相关传输函数(HRTF)对于创建逼真的虚拟现实(VR)与增强现实(AR)环境非常重要。然而,声学测量高质量HRTF需要昂贵设备与声学实验室环境。为克服这些限制并提升测量效率,过去已利用HRTF上采样技术,即从低分辨率HRTF生成高分辨率HRTF。本文展示了如何将生成对抗网络(GANs)应用于HRTF上采样。我们提出一种新颖方法,对HRTF数据进行变换以直接与卷积超分辨率生成对抗网络(SRGAN)配合使用。该新方法针对三种基线进行了基准测试:重心上采样、球谐(SH)上采样以及一种HRTF选择方法。实验结果表明,当输入HRTF稀疏(少于20个测量位置)时,所提方法在对数谱失真(LSD)以及基于感知模型的定位性能方面均优于所有三种基线。

关键词

引用

@article{arxiv.2306.05812,
  title  = {HRTF upsampling with a generative adversarial network using a gnomonic equiangular projection},
  author = {Aidan O. T. Hogg and Mads Jenkins and He Liu and Isaac Squires and Samuel J. Cooper and Lorenzo Picinali},
  journal= {arXiv preprint arXiv:2306.05812},
  year   = {2024}
}

备注

15 pages, 9 figures, Preprint (Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing on the 15 Feb 2024)