基于序列到序列神经网络利用词汇与声学线索的多模态说话人分割与日记化
音频与语音处理
2018-05-29 v1 声音
摘要
尽管近期在说话人日记化方面已有大量工作,但联合使用词汇与声学信息进行说话人分割的努力甚少。为此,我们研究了一种使用在词汇与声学特征上训练的序列到序列神经网络的说话人日记化系统。我们还提出了一种损失函数,通过允许不同的说话人分组,不仅能够选择说话人变化点,还能在任何时刻选出最佳说话人。我们将梅尔频率倒谱系数(MFCC)作为声学特征,与从 Fisher 数据集对话中获得的词汇信息结合。由此,我们表明声学为词汇模态提供了互补信息。实验结果表明,在词序列和 MFCC 上训练的序列到序列系统相比仅依赖词汇模态或基于 MFCC 的基线系统,能够改善说话人日记化结果。此外,我们使用自动语音识别(ASR)转写文本测试了所提方法的性能。尽管在 ASR 转写文本上的性能有所下降,我们提出方法的日记化错误率(DER)仍优于基于贝叶斯信息准则(BIC)的传统方法。
引用
@article{arxiv.1805.10731,
title = {Multimodal Speaker Segmentation and Diarization using Lexical and Acoustic Cues via Sequence to Sequence Neural Networks},
author = {Tae Jin Park and Panayiotis Georgiou},
journal= {arXiv preprint arXiv:1805.10731},
year = {2018}
}