中文

深度学习在个性化全声频音频再现中的应用

音频与语音处理 2025-09-03 v1 声音

摘要

个性化全声频音频再现是实现真实空间定位、声音外部化和沉浸式聆听的基础,直接塑造用户体验和聆听效率。本综述 reviews 最近在深度学习中用于此任务的进展,并按生成机制分为两个范式进行组织:显式个性化滤波与端到端渲染。显式方法从稀疏测量、形态特征或环境线索预测个性化头部相关传递函数(HRTF),随后用于传统渲染管道。端到端方法则将源信号直接映射到全声频信号,辅以视觉、文本或参数化指导,并在模型中学习个性化。我们还总结了该领域的主要数据集和评估指标,以支持公平且可重复的比较。最后,我们讨论了这些技术所启用的关键应用、当前技术限制以及基于深度学习的空间音频系统的潜在研究方向。

关键词

引用

@article{arxiv.2509.00400,
  title  = {Deep Learning for Personalized Binaural Audio Reproduction},
  author = {Xikun Lu and Yunda Chen and Zehua Chen and Jie Wang and Mingxing Liu and Hongmei Hu and Chengshi Zheng and Stefan Bleeck and Jinqiu Sang},
  journal= {arXiv preprint arXiv:2509.00400},
  year   = {2025}
}