编码器-解码器多模态说话人变换检测
声音
2023-06-02 v1 人工智能
音频与语音处理
摘要
说话人变换检测(SCD)任务用于检测输入中说话人发生变换的位置,对若干应用至关重要。已有若干研究仅利用音频输入解决 SCD 任务,但性能有限。近来,除音频外还利用文本模态的多模态 SCD(MMSCD)模型展现出改进的性能。在本研究中,所提模型基于两项主要设想构建:一种新颖的模态融合机制,以及采用编码器-解码器架构。与以往从与单个词对齐的极短音频段提取说话人嵌入的 MMSCD 工作不同,我们使用从 1.5 秒音频中提取的说话人嵌入。一个 transformer 解码器层进一步提升了仅编码器 MMSCD 模型的性能。所提模型在报告 SCD 性能的研究中取得了最先进(SOTA)结果,并且与近期通过人工转写将 SCD 与自动语音识别相结合的工作表现相当。
引用
@article{arxiv.2306.00680,
title = {Encoder-decoder multimodal speaker change detection},
author = {Jee-weon Jung and Soonshin Seo and Hee-Soo Heo and Geonmin Kim and You Jin Kim and Young-ki Kwon and Minjae Lee and Bong-Jin Lee},
journal= {arXiv preprint arXiv:2306.00680},
year = {2023}
}
备注
5 pages, accepted for presentation at INTERSPEECH 2023