HRTFformer:用于沉浸式音频渲染的面向空间的 HRTF 上采样 Transformer
声音
2025-10-03 v1 人工智能
音频与语音处理
摘要
个人化头部相关传递函数(HRTF)正在被引入许多商业沉浸式音频应用中,对实现真实的空间音频渲染至关重要。然而,创建个人化 HRTF 因测量过程的复杂性而难以大规模实施。这一缺点可通过 HRTF 空间上采样来缓解,其旨在减少所需的测量次数。尽管先前的工作已使用不同的机器学习方法取得成功,但这些模型常在长程空间一致性和高倍率上采样的泛化性方面存在挑战。本文提出了一种新型基于 Transformer 的 HRTF 上采样架构,利用注意力机制更好地捕捉 HRTF 球面上的空间关联。我们在球面调和(SH)域中工作,该模型学习从稀疏输入测量重建高分辨率 HRTF,显著提高了准确性。为增强空间连贯性,我们引入了邻域不相似性损失,以促进幅度平滑,生成更真实的上采样结果。我们使用感知局部化模型和客观谱波畸变指标对方法进行评估。实验表明,我们的方法在生成真实、高保真 HRTF 方面显著优于领先方法。
关键词
引用
@article{arxiv.2510.01891,
title = {HRTFformer: A Spatially-Aware Transformer for Personalized HRTF Upsampling in Immersive Audio Rendering},
author = {Xuyi Hu and Jian Li and Shaojie Zhang and Stefan Goetz and Lorenzo Picinali and Ozgur B. Akan and Aidan O. T. Hogg},
journal= {arXiv preprint arXiv:2510.01891},
year = {2025}
}
备注
10 pages and 5 figures