中文

广播中的 Dialog+:基于深度学习的对话增强首次现场测试

音频与语音处理 2021-12-20 v1 信号处理

摘要

在广播中,由于背景声音过大而难以听清语音是常见的问题。基于对象的音频,例如 MPEG-H Audio,通过提供用户可调节的语音电平解决了这一问题。虽然基于对象的音频正获得发展势头,但向它的过渡需要时间与精力。此外,大量内容是在基于对象的工作流之外制作和归档的。为此,Fraunhofer IIS 开发了一种称为 Dialog+ 的深度学习解决方案,能够为仅有最终音频轨可用的内容也实现语音电平个性化。本文报道了由 Fraunhofer IIS 与 Westdeutscher Rundfunk (WDR) 和 Bayerischer Rundfunk (BR) 合作开展、自 2020 年 9 月开始的 Dialog+ 公开现场测试。据我们所知,这是此类首次大规模测试。作为其中一项测试的一部分,一项超过 2,000 名参与者的调查显示,60 岁以上人群中有 90% 的人“经常”或“非常经常”在电视中听不清语音。总体而言,83% 的参与者喜欢切换到 Dialog+ 的可能性,包括那些通常不存在语音可懂度困难的人。Dialog+ 为受众带来了明确益处,填补了基于对象的广播与传统制作素材之间的鸿沟。

关键词

引用

@article{arxiv.2112.09494,
  title  = {Dialog+ in Broadcasting: First Field Tests Using Deep-Learning-Based Dialogue Enhancement},
  author = {Matteo Torcoli and Christian Simon and Jouni Paulus and Davide Straninger and Alfred Riedel and Volker Koch and Stefan Wits and Daniela Rieger and Harald Fuchs and Christian Uhle and Stefan Meltzer and Adrian Murtaza},
  journal= {arXiv preprint arXiv:2112.09494},
  year   = {2021}
}

备注

Presented at IBC 2021 (International Broadcasting Convention)