TS-SEP:基于估计说话人嵌入的联合说话人日志与分离方法
音频与语音处理
2025-01-23 v3 声音
摘要
由于会议数据的说话人日志与源分离是紧密相关的任务,我们在此提出一种联合完成这两个目标的方法。它建立在目标说话人语音活动检测(TS-VAD)说话人日志方法之上,该方法假定初始说话人嵌入可用。我们将 TS-VAD 最终的联合说话人活动估计网络替换为在时频分辨率上产生说话人活动估计的网络。这些估计充当源提取的掩码,可通过掩蔽或波束成形实现。该技术可应用于单通道和多通道输入,并且在两种情况下均在 LibriCSS 会议数据识别任务上取得了新的最先进词错误率(WER)。我们进一步计算说话人感知与说话人无关的 WER,以分离说话人日志错误对整体 WER 性能的贡献。
引用
@article{arxiv.2303.03849,
title = {TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings},
author = {Christoph Boeddeker and Aswin Shanmugam Subramanian and Gordon Wichern and Reinhold Haeb-Umbach and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2303.03849},
year = {2025}
}
备注
Submitted to IEEE/ACM TASLP