更好在一起:面向电视音频个性化的对话分离与语音活动检测
音频与语音处理
2023-03-24 v1 声音
摘要
在电视服务中,对话电平个性化是满足用户偏好与需求的关键。当对话与背景声音在生产阶段未单独可用时,对话分离(DS)可对其估计以实现个性化。研究表明 DS 为终端用户提供了明确益处。然而,估计信号并不完美,可能引入某些泄漏。这是不受欢迎的,尤其在无对话的段落中。我们提议将 DS 与语音活动检测(VAD)相结合,二者近期均被提出用于电视音频。当它们的组合表明无对话活动时,将泄漏到对话估计中的背景成分重新分配给背景估计。结果显示,对于无对话信号,音频质量得到明显改善,而在对话活跃时性能未下降。同时还生成了检测精度提升的后处理 VAD 估计。结论是 DS 与 VAD 可相互改进,最好协同使用。
引用
@article{arxiv.2303.13453,
title = {Better Together: Dialogue Separation and Voice Activity Detection for Audio Personalization in TV},
author = {Matteo Torcoli and Emanuël A. P. Habets},
journal= {arXiv preprint arXiv:2303.13453},
year = {2023}
}
备注
Paper accepted to the 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023), Rhodes, Greece