基于说话人感知CTC的多说话人语音识别中的说话人解缠
音频与语音处理
2025-01-06 v2 人工智能
声音
摘要
多说话人语音识别(MTASR)在分离和转录重叠语音方面面临独特挑战。为应对这些挑战,本文研究了连接时序分类(CTC)在与序列化输出训练(SOT)结合用于MTASR时,在说话人解缠中的作用。我们的可视化分析表明,CTC引导编码器在声学嵌入的不同时间区域表征不同说话人。基于这一发现,我们提出了一种新颖的说话人感知CTC(SACTC)训练目标,其基于贝叶斯风险CTC框架。SACTC是针对多说话人场景量身定制的CTC变体,它通过约束编码器在特定时间帧表征不同说话人的词元,显式地对说话人解缠进行建模。当与SOT集成时,SOT-SACTC模型在各种语音重叠程度下均持续优于标准SOT-CTC。具体而言,我们观察到总体词错误率相对降低10%,在低重叠语音上降低15%。这项工作是对基于CTC的MTASR任务增强的初步探索,为多说话人语音识别中的说话人解缠提供了新视角。代码可在 https://github.com/kjw11/Speaker-Aware-CTC 获取。
关键词
引用
@article{arxiv.2409.12388,
title = {Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC},
author = {Jiawen Kang and Lingwei Meng and Mingyu Cui and Yuejiao Wang and Xixin Wu and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2409.12388},
year = {2025}
}
备注
Accepted by ICASSP2025