利用外部知识源的语言学约束进行音视频目标语音提取
声音
2025-06-17 v2 机器学习
多媒体
音频与语音处理
摘要
音视频目标说话人提取(AV-TSE)模型主要依赖目标视觉线索来从其他说话人中分离目标说话人的语音。人类利用语法和语义等语言学知识来支持语音感知,受此启发,我们探索了预训练语音语言模型(PSLMs)和预训练语言模型(PLMs)作为 AV-TSE 辅助知识源的潜力。本研究中,我们提出将来自 PSLMs 或 PLMs 的语言学约束作为 AV-TSE 模型的额外监督信号。无需引入推理过程中的额外计算开销,所提方法持续提升语音质量与可懂度。此外,我们在多语言设置和视觉线索受损场景下评估了所提方法,展现出稳健的性能提升。
引用
@article{arxiv.2506.09792,
title = {Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction},
author = {Wenxuan Wu and Shuai Wang and Xixin Wu and Helen Meng and Haizhou Li},
journal= {arXiv preprint arXiv:2506.09792},
year = {2025}
}
备注
Accepted by Interspeech 2025