MISP 2023 挑战赛中基于音频质量的多策略目标说话人提取方法
声音
2024-03-08 v2 音频与语音处理
摘要
本文描述了我们用于多模态信息语音处理(MISP)2023 挑战赛中视听目标说话人提取(AVTSE)任务的基于音频质量的多策略方法。具体而言,我们的方法根据音频质量采用不同的提取策略,在干扰去除与语音保留之间取得平衡,这有利于后端自动语音识别(ASR)系统。实验表明,我们的方法在 Dev 和 Eval 集上分别实现了 24.2% 和 33.2% 的字符错误率(CER),在挑战赛中获得了第二名。
关键词
引用
@article{arxiv.2401.03697,
title = {An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge},
author = {Runduo Han and Xiaopeng Yan and Weiming Xu and Pengcheng Guo and Jiayao Sun and He Wang and Quan Lu and Ning Jiang and Lei Xie},
journal= {arXiv preprint arXiv:2401.03697},
year = {2024}
}
备注
Accepted by ICASSP 2024