利用说话人嵌入提升间歇性和移动说话人跟踪效果
音频与语音处理
2025-06-26 v1 人工智能
声音
摘要
说话人跟踪方法通常依赖空间观测来在时间内为轨迹分配连贯的轨迹身份。这在间歇性和移动说话人场景中存在限制,即说话人在非活跃期可能改变位置,从而导致空间轨迹中断。本文提出利用说话人嵌入来解决此问题。我们提出在跟踪后进行身份重新分配,使用说话人嵌入。我们利用初始跟踪步骤提供的轨迹相关信息和多通道音频信号。采用波束成形技术以增强指向说话人位置的信号,从而计算说话人嵌入。随后,这些嵌入用于根据 enrollment 池分配新的轨迹身份。我们在说话人在非活跃期间改变位置的数据集上评估了所提出的说话人嵌入基身份重新分配方法的性能。结果表明,它一致地改善了神经网络和标准跟踪系统的身份分配性能。特别地,我们研究了波束成形和输入持续时间对嵌入提取的影响。
引用
@article{arxiv.2506.19875,
title = {Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers},
author = {Taous Iatariene and Can Cui and Alexandre Guérin and Romain Serizel},
journal= {arXiv preprint arXiv:2506.19875},
year = {2025}
}
备注
33rd European Signal Processing Conference (EUSIPCO 2025), Sep 2025, Palerme (Italie), Italy