中文

基于卷积神经网络(CNN)的空间音频与个性化 HRTF

音频与语音处理 2023-11-23 v1 声音

摘要

空间音频与三维声音渲染技术在沉浸式音频体验中起着关键且重要的作用。头相关传输函数(HRTF)是声学滤波器,表征声音如何与个体独特的头部及耳部解剖结构相互作用。使用符合受试者解剖特征的 HRTF 对于确保个性化且独特的空间体验至关重要。本工作提出一种基于人体测量特征的 HRTF 个性化方法,这些特征利用卷积神经网络(CNN)从耳部图像中自动提取。首先,实现并测试了一个 CNN,以评估机器学习在耳部图像上定位特征点的性能。包含带有相应 55 个特征点的耳部图像的 I-BUG 数据集用于训练和测试该神经网络。随后,选取 12 个相关特征点以对应 HUTUBS 数据库建立的 7 项特定人体测量尺寸。这些特征点作为像素距离计算的参考,以便从耳部图像中获取人体测量尺寸。一旦从耳部图像中提取出 7 个像素距离,便使用转换因子将其换算为厘米,并实现最佳匹配方法向量,通过对 HUTUBS 数据库提供的含相应 7 项人体测量尺寸的 116 只耳朵的每一组计算欧氏距离来匹配。可识别出最接近的人体测量匹配,并获取相应的一组 HRTF 以供个性化使用。该方法在其有效性而非结果准确性方面受到评估。各阶段的概念范围已被验证并证实可正确运行。对流程中的各个步骤及可用要素进行了审视与推敲,以定义一个面向所需任务的更完备的算法整体。

关键词

引用

@article{arxiv.2311.13397,
  title  = {Spatial Audio and Individualized HRTFs using a Convolutional Neural Network (CNN)},
  author = {Ludovic Pirard},
  journal= {arXiv preprint arXiv:2311.13397},
  year   = {2023}
}