一瞥足矣:通过关键词提取目标语句
计算与语言
2023-10-10 v1 声音
音频与语音处理
摘要
本文研究仅以关键词作为输入,从多人混合语音中提取目标语句的可能性。例如,在安防应用中,关键词可能为“help”,目标是识别呼救者所说内容而忽略其他说话人。为解决该问题,我们提出使用Transformer架构对关键词与语音片段进行嵌入,并依靠交叉注意力机制从拼接或重叠的语音中选择正确内容。在Librispeech上的实验结果表明,我们所提方法能从极嘈杂且混合的语音(SNR=-3dB)中有效提取目标语句,取得26%的音素错误率(PER),而基线系统的PER为96%。
引用
@article{arxiv.2310.05352,
title = {A Glance is Enough: Extract Target Sentence By Looking at A keyword},
author = {Ying Shi and Dong Wang and Lantian Li and Jiqing Han},
journal= {arXiv preprint arXiv:2310.05352},
year = {2023}
}
备注
submitted to ICASSP 2024