中文

基于 Transformer 的目标说话人语音活动检测及其与端到端神经日记化的集成

音频与语音处理 2022-09-27 v3 计算与语言 声音

摘要

本文描述了一种基于目标说话人语音活动检测 (TS-VAD) 并使用 Transformer 的说话人日记化模型。为克服原始 TS-VAD 模型无法处理任意数量说话人的缺陷,我们研究了采用具有可变长度时间与说话人维度输入张量的模型架构。Transformer 层应用于说话人轴,使模型输出对提供给 TS-VAD 模型的说话人画像顺序不敏感。在这些说话人级 Transformer 层之间穿插时间级序列层,以捕获输入语音信号的时序与跨说话人相关性。我们还扩展了基于端到端神经日记化与编码器-解码器吸引子 (EEND-EDA) 的日记化模型,将其基于点积的说话人检测层替换为基于 Transformer 的 TS-VAD。在 VoxConverse 上的实验结果表明,使用 Transformer 进行跨说话人建模将 TS-VAD 的日记化错误率 (DER) 降低了 11.3%,实现了 4.57% 的新的 state-of-the-art (SOTA) DER。此外,在相似模型规模下,我们扩展的 EEND-EDA 在 CALLHOME 数据集上相对原始 EEND-EDA 将 DER 降低了 6.9%,在广泛使用的训练数据设置下实现了 11.18% 的新 SOTA DER。

关键词

引用

@article{arxiv.2208.13085,
  title  = {Target Speaker Voice Activity Detection with Transformers and Its Integration with End-to-End Neural Diarization},
  author = {Dongmei Wang and Xiong Xiao and Naoyuki Kanda and Takuya Yoshioka and Jian Wu},
  journal= {arXiv preprint arXiv:2208.13085},
  year   = {2022}
}