时空活动信息驱动的说话人活动识别与分离
音频与语音处理
2024-01-31 v1 声音
摘要
提出了一种利用说话人时空活动的鲁棒多通道说话人活动识别与分离系统。该系统在阵列信号处理单元和深度学习单元之间构建了混合架构。对于说话人活动识别,计算基于麦克风阵列的白化相对传递函数(wRTFs)的时域一致性矩阵。该特征无需依赖于阵列配置的先验知识,即可为后续机器学习提供鲁棒性。构建了一个计算效率高的时空活动驱动说话人活动识别网络 (SASDnet),用于直接从时空一致性矩阵中估计说话人活动。对于说话人分离,我们提出了全局和局部活动驱动说话人提取网络 (GLASEnet),通过说话人特定的全局和局部时空活动函数来分离说话人信号。局部时空活动函数取决于每个时频箱子与目标说话人主导箱子之间的一致性。全局时空活动函数基于频率平均后的局部时空活动函数计算得到。实验结果表明,所提出的系统在说话人、活动识别、计数和分离方面性能优于已选基准,同时计算复杂度较低。
引用
@article{arxiv.2401.16850,
title = {Spatial-Temporal Activity-Informed Diarization and Separation},
author = {Yicheng Hsu and Ssuhan Chen and Mingsian R. Bai},
journal= {arXiv preprint arXiv:2401.16850},
year = {2024}
}
备注
13 pages