ConceptBeam:基于概念驱动的目标语音提取
音频与语音处理
2022-07-26 v1 机器学习
多媒体
声音
摘要
我们提出了一种基于语义信息的目标语音提取新框架,称为 ConceptBeam。目标语音提取是指从混合语音中提取出目标说话人的语音。典型方法一直利用音频信号的特性,如谐波结构和到达方向。相比之下,ConceptBeam 用语义线索解决这个问题。具体而言,我们使用概念指定器(如图像或语音)提取谈论某一概念(即感兴趣的主题)的说话人的语音。解决这一新问题将为创新应用打开大门,例如聚焦于对话中特定话题的听觉系统。与关键词不同,概念是抽象概念,难以直接表示目标概念。在我们的方案中,概念通过将对概念指定器映射到共享嵌入空间而编码为语义嵌入。该模态无关空间可通过使用由图像及其口语描述组成的配对数据进行深度度量学习来构建。我们用它来桥接模态相关信息(即混合中的语音段)与指定的模态无关概念。作为我们方案的验证,我们使用一组与口语描述相关联的图像进行了实验。即,我们从这些口语描述生成语音混合,并使用图像或语音信号作为概念指定器。然后利用所识别段的声学特性提取目标语音。我们将 ConceptBeam 与两种方法比较:一种基于从识别系统获得的关键词,另一种基于声源分离。我们表明 ConceptBeam 明显优于基线方法,并基于语义表示有效地提取语音。
引用
@article{arxiv.2207.11964,
title = {ConceptBeam: Concept Driven Target Speech Extraction},
author = {Yasunori Ohishi and Marc Delcroix and Tsubasa Ochiai and Shoko Araki and Daiki Takeuchi and Daisuke Niizumi and Akisato Kimura and Noboru Harada and Kunio Kashino},
journal= {arXiv preprint arXiv:2207.11964},
year = {2022}
}
备注
Accepted to ACM Multimedia 2022