基于波形域神经网络的全景声超分辨率
音频与语音处理
2025-08-04 v1 声音
摘要
全景声是描述声场的空间音频格式。一级全景声(FOA)是一种流行格式,仅包含四个通道。这种有限的通道数以牺牲空间精度为代价。理想情况下,能够以FOA格式的效率为代价获得更高的质量。我们构思了一种数据驱动的空间音频解决方案,保留FOA格式的效率,但实现的质量超过传统渲染器。利用全卷积时域音频神经网络(Conv-TasNet),我们创建了一个解决方案,可接受FOA输入并提供更高阶全景声(HOA)输出。与典型的物理和精神声学基础渲染器相比,这种数据驱动方法是新的。定量评估显示,预测值与实际第三阶HOA之间平均位置均方误差差为0.6 dB。中性质量评级显示,与传统渲染方法相比,感知质量提升了80%。
关键词
引用
@article{arxiv.2508.00240,
title = {Ambisonics Super-Resolution Using A Waveform-Domain Neural Network},
author = {Ismael Nawfal and Symeon Delikaris Manias and Mehrez Souden and Juha Merimaa and Joshua Atkins and Elisabeth McMullin and Shadi Pirhosseinloo and Daniel Phillips},
journal= {arXiv preprint arXiv:2508.00240},
year = {2025}
}