中文

面向儿童-成人互动的端到端联合语音识别与说话人角色分离

音频与语音处理 2026-01-27 v1 声音

摘要

准确地转录儿童-成人语音互动并进行说话人角色分离,对发展和临床研究至关重要。然而,手动标注耗时且难以扩展。现有的自动系统通常依赖级联式说话人分离和语音识别管道,可能导致误差传播。本文提出一种统一的端到端框架,将 Whisper 编码器-解码器架构扩展至联合建模语音识别(ASR)和儿童-成人说话人角色分离。该方法集成了:(i)一种序列化输出训练方案,发出说话人标签和开始/结束时间戳;(ii)一个轻量级帧级分离头,以增强说话人判别性编码器表示;(iii)面向改进时序精度的说话人引导静音抑制;以及(iv)一种基于状态机的强制解码程序,确保结构上有效的输出。全面评估两个数据集表明,本方法在两个级联基线之上实现了一致且显著的改进,实现了更低的多说话人词错误率,并在 Whisper-small 和 Whisper-large 模型中展现出具竞争力的分离准确率。这些发现凸显了该联合建模框架在大规模生成可靠且带说话人属性标注的转录文本方面的有效性和实用性。代码和模型权重已公开可用。

关键词

引用

@article{arxiv.2601.17640,
  title  = {End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions},
  author = {Anfeng Xu and Tiantian Feng and Somer Bishop and Catherine Lord and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2601.17640},
  year   = {2026}
}

备注

Under review for IEEE