Flow-TSVAD:基于潜在流匹配的目标说话人语音活动检测
声音
2024-09-20 v2 音频与语音处理
摘要
说话人日志通常被视为一个判别性任务,使用判别性方法产生固定的日志结果。本文首次探索了使用基于神经网络的生成方法进行说话人日志。我们在序列到序列的目标说话人语音活动检测(Seq2Seq-TSVAD)日志系统中实现了一种基于流匹配(FM)的生成算法。我们的实验表明,将生成方法直接应用于 TS-VAD 输出的原始二元标签序列空间是无效的。为了解决这个问题,我们提出在应用生成算法之前,将二元标签序列映射到一个稠密的潜在空间,我们提出的 Flow-TSVAD 方法优于 Seq2Seq-TSVAD 系统。此外,我们观察到 FM 算法在推理阶段收敛迅速,仅需两步推理即可获得有希望的结果。作为一种生成模型,Flow-TSVAD 允许通过多次运行模型来采样不同的日志结果。此外,集成来自不同采样实例的结果进一步提升了日志性能。
引用
@article{arxiv.2409.04859,
title = {Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching},
author = {Zhengyang Chen and Bing Han and Shuai Wang and Yidi Jiang and Yanmin Qian},
journal= {arXiv preprint arXiv:2409.04859},
year = {2024}
}
备注
submitted to ICASSP 2025