基于Transformer的端到端说话人日志
声音
2021-12-15 v1 音频与语音处理
摘要
说话人日志与计算机视觉中的语义分割相关联。受将语义分割视为集合预测问题的MaskFormer \cite{cheng2021per} 启发,我们提出一种端到端方法来预测由二值掩码、语音活动和说话人向量组成的目標集合。我们的模型称为\textit{DiFormer},主要基于说话人编码器和特征金字塔网络(FPN)模块来提取多尺度说话人特征,随后将其输入Transformer编码器-解码器以从学习的查询嵌入中预测一组日志目标。为考虑语音信号的时间特性,在掩码预测模块中插入双向LSTM以改善时间一致性。我们的模型以统一方式处理未知数量说话人、语音重叠以及语音活动检测。在多媒体和会议数据集上的实验证明了我们方法的有效性。
引用
@article{arxiv.2112.07463,
title = {End-to-end speaker diarization with transformer},
author = {Yongquan Lai and Xin Tang and Yuanyuan Fu and Rui Fang},
journal= {arXiv preprint arXiv:2112.07463},
year = {2021}
}
备注
submitted to icassp2022