在对话分离音频中预测偏好对话-背景响度差
音频与语音处理
2023-06-01 v2 声音
摘要
对话增强(DE)能够在广播音频背景下重新平衡对话与背景声音,以契合个人偏好与需求。当制作中无法获得独立音轨时,可对最终音频混音应用对话分离(DS)来估计这些音轨。本工作关注对话与背景声音之间的偏好响度差(PLD)。先前研究通过采用制作原始音轨的听音测试确定 PLD,而本研究使用由 DS 估计的音轨。此外,考虑了更多样的信号类别。PLD 在个体间差异显著(平均四分位距:5.7 LU)。尽管存在这种变异性,研究发现 PLD 高度依赖于所考虑的信号类型,并且表明中位数 PLD 可使用客观可懂度指标进行预测。两种已有的基线预测方法——旨在用于原始音轨——的 Mean Absolute Error(MAE)分别为 7.5 LU 和 5 LU。本文提出了一种改进基线(MAE:3.2 LU)和一种替代方法(MAE:2.5 LU)。结果支持了使用 DS 处理最终广播混音并提供考虑中位数 PLD 的替代重混音的可行性。
引用
@article{arxiv.2305.19100,
title = {Predicting Preferred Dialogue-to-Background Loudness Difference in Dialogue-Separated Audio},
author = {Luca Resti and Martin Strauss and Matteo Torcoli and Emanuël Habets and Bernd Edler},
journal= {arXiv preprint arXiv:2305.19100},
year = {2023}
}
备注
Paper accepted at the 15th International Conference on Quality of Multimedia Experience (QoMEX), 4 pages, 2 figures