面向说话人角色的 ASR 同步说话人角色分割
音频与语音处理
2025-12-23 v3 人工智能
机器学习
摘要
说话人角色分割(RD),例如医生与患者或律师与客户,往往比传统说话人分割(SD)更实用,后者仅分配通用标签(说话人-1、说话人-2)。当前最佳端到端 ASR+RD 方法使用单个 transducer 将单词与角色预测序列化(角色在说话人轮次结束时),但会牺牲 ASR 性能。为此,我们改进最近的联合 ASR+SD 框架,用于 ASR+RD,通过冻结 ASR transducer 并并行训练辅助 RD transducer 为每个 ASR 预测的单词分配角色。首先,我们表明 SD 与 RD 本质上是不同任务,两者在声学和语言信息上的依赖性不同。基于此,我们提出:1) 任务特定的预测网络;以及2) 将高层 ASR 编码器特征作为 RD 编码器的输入。此外,我们用交叉熵损失沿 1-best forced-alignment 路径取代 blank-shared RNNT 损失,以进一步提升性能,同时降低 RD 训练期间的计算和内存需求。在公开数据集和私有数据集上的实验表明,我们的方法在角色基词分割误差率(R-WDER)上分别比最佳基线降低了6.2%和4.5%。
引用
@article{arxiv.2507.17765,
title = {ASR-Synchronized Speaker-Role Diarization},
author = {Arindam Ghosh and Mark Fuhs and Bongjun Kim and Anurag Chowdhury and Monika Woszczyna},
journal= {arXiv preprint arXiv:2507.17765},
year = {2025}
}
备注
Work in progress