广播与流媒体中的语音响度
音频与语音处理
2024-05-28 v1
摘要
在广播和流媒体中引入并规范响度为受众带来了明显益处,例如各节目和频道间的响度一致性。然而,经常有报告称某些片段中的语音响度过低,这可能会妨碍观众对电影和电视节目的充分理解与欣赏。本文提议扩展业界通常使用的基于响度的测度集合。我们关注语音响度,并表明当无法获得纯净语音时,可以使用深度神经网络 (DNNs) 来分离语音信号,从而准确估计语音响度,与语音门控响度相比提供了更精确的估计。此外,我们定义了关键片段,即语音可能难以被听懂的片段。关键片段是基于局部语音响度偏差 (SLD) 和局部语音-背景响度差 (SBLD) 定义的,因为 SLD 和 SBLD 对可懂度和聆听努力有显著贡献。与其他更全面的可懂度和聆听努力测度相比,SLD 和 SBLD 易于测量、直观,且最重要的是,可以通过调整混音中的语音电平或在用户端启用个性化来轻松控制。最后,我们提供了示例,展示了关键片段的检测如何支持内容制作期间和制作后对语音信号的评估与控制。
引用
@article{arxiv.2405.17364,
title = {Speech Loudness in Broadcasting and Streaming},
author = {Matteo Torcoli and Mhd Modar Halimeh and Thomas Leitz and Yannik Grewe and Michael Kratschmer and Bernhard Neugebauer and Adrian Murtaza and Harald Fuchs and Emanuël A. P. Habets},
journal= {arXiv preprint arXiv:2405.17364},
year = {2024}
}
备注
Accepted for presentation at the Audio Engineering Society (AES) 156th Convention, June 2024, Madrid, Spain