基于到来时间排序的流式Sortformer:讲师缓存式在线讲师定位
音频与语音处理
2025-07-25 v1 声音
摘要
本文提出了Sortformer讲师定位框架的流式扩展方案,其关键特性在于输出讲师的到来时间排序。所提出的方法采用到来次序讲师缓存(Arrival-Order Speaker Cache, AOSC)存储先前观察到的讲师的帧级声学嵌入。与传统讲师追踪缓冲区不同,AOSC按讲师索引对应其到来时间顺序对嵌入进行排序,并通过选择模型过去预测得分最高的帧来动态更新。值得注意的是,每位讲师存储的嵌入数量由更新机制动态决定,确保高效的缓存利用和精确的讲师跟踪。在基准数据集上的实验确认了该方法的有效性和灵活性,即使在低延迟设置下也能实现。这些结果将Streaming Sortformer确立为实时多讲师跟踪的稳健解决方案,并为流式多说话者语音处理奠定了基础。
引用
@article{arxiv.2507.18446,
title = {Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering},
author = {Ivan Medennikov and Taejin Park and Weiqing Wang and He Huang and Kunal Dhawan and Jinhan Wang and Jagadeesh Balam and Boris Ginsburg},
journal= {arXiv preprint arXiv:2507.18446},
year = {2025}
}
备注
Accepted to Interspeech 2025