基于单通道模型的数据驱动空间音频增强潜力探索
音频与语音处理
2024-04-24 v1 声音
摘要
单通道和多通道语音增强与声学消混方法的一个关键区别在于,后者的Problem formulation和solution complexity都显著更具挑战性。此外,在有限的计算资源下,训练需要管理更大数据集或更复杂设计的模型会显得笨拙。在这种情况下,单通道方法能简单地适应多通道场景(仅通过独立处理每个通道)这一未经验证的假设具有重大的意义,这不仅提高了声场捕获与系统输入输出格式之间的兼容性,还允许现代研究聚焦于其他具有挑战性的方面,如全带宽音频增强、竞争性噪声抑制和无监督学习。本研究通过将基本单通道语音增强和消混模型与两个专为从噪声3D混合音中分离干净语音而设计的多通道模型进行比较来验证了这一假设。使用方向到达估计模型客观评估其保存空间信息的能力,通过将输出信号与真实坐标值进行比较。最终,在获得更低 intelligibility 分数的代价下,以更简单的方式保存空间信息形成了一种权衡。
引用
@article{arxiv.2404.14564,
title = {Exploring the Potential of Data-Driven Spatial Audio Enhancement Using a Single-Channel Model},
author = {Arthur N. dos Santos and Bruno S. Masiero and Túlio C. L. Mateus},
journal= {arXiv preprint arXiv:2404.14564},
year = {2024}
}