中文

Sortformer:面向语音转文本系统中实现排列解析说话人监督的新方法

音频与语音处理 2025-07-22 v3 计算与语言 机器学习 声音

摘要

Sortformer 是一种基于编码器的说话人定位模型, 用于监督语音转文本模型中的说话人标记。与仅依赖排列不变损失(PIL)不同, Sortformer 引入 Sort Loss 来解决排列问题, 可独立或与 PIL 并行使用。此外, 我们提出了一种简洁的多说话人语音转文本架构, 利用 Sortformer 进行说话人监督, 将说话人标签嵌入编码器中使用正弦核函数。该设计通过排序目标解决说话人排列问题, 有效地将时间戳和 token 连接起来, 在输出转录文本中监督说话人标签。实验表明, Sort Loss 可以提升说话人定位性能, 纳入 Sortformer 的说话人监督可提高多说话人转录准确率。我们预计所提出的 Sortformer 和多说话人架构将使其 seamless 集成说话人标记功能至基础语音转文本系统和多模态大型语言模型(LLMs), 为增强其在说话人感知任务中的 versatility 和 performance 提供易于采纳且用户友好的机制。该代码和训练好的模型已通过 NVIDIA NeMo 框架公开提供。

关键词

引用

@article{arxiv.2409.06656,
  title  = {Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems},
  author = {Taejin Park and Ivan Medennikov and Kunal Dhawan and Weiqing Wang and He Huang and Nithin Rao Koluguri and Krishna C. Puvvada and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2409.06656},
  year   = {2025}
}

备注

Published at ICML 2025