中文

面向感知引导的潜在 HRTF 表示

音频与语音处理 2026-01-27 v1 声音

摘要

个性化头部相关传递函数 (HRTF) 对于确保通过耳机获得真实的听觉体验至关重要,因为它们考虑了影响听觉的个人解剖差异。大多数机器学习方法的 HRTF 个性化依赖于 learned 的低维潜在空间来生成或选择特定听众的定制 HRTF。然而,这些潜在表示通常以优化谱重建但不针对感知兼容性来学习,这意味着它们可能不一定与感知距离一致。本文首先研究传统学习的 HRTF 表示是否与感知关系相关,使用基于听觉的客观感知指标;然后,我们提出了一种方法,显式地将 HRTFs 嵌入感知导向的潜在空间,利用基于度量的损失函数和 Metric 多维标度 (MMDS) 的监督。最后,我们展示了这些学习到的表示用于 HRTF 个性化任务的可行性。我们认为本方法有潜力实现个人化空间音频,从而改善听觉体验。

关键词

引用

@article{arxiv.2507.02815,
  title  = {Towards Perception-Informed Latent HRTF Representations},
  author = {You Zhang and Andrew Francl and Ruohan Gao and Paul Calamia and Zhiyao Duan and Ishwarya Ananthabhotla},
  journal= {arXiv preprint arXiv:2507.02815},
  year   = {2026}
}

备注

Accepted by IEEE WASPAA 2025, camera-ready version