一个用于联合说话人分割与识别的工具包及其在说话人归属自动语音识别中的应用
音频与语音处理
2024-09-10 v1 多媒体
摘要
我们展示了一个模块化工具包,用于执行联合说话人分割和说话人识别。该工具包可以利用在配置文件中定义的多个模型和算法。这种灵活性使我们的系统能够在各种条件(例如,多个注册说话人集合、声学条件和语言)下以及跨应用领域(例如,媒体监测、机构、语音分析)正常工作。在此演示中,我们展示了一个实际用例,其中说话人相关信息与自动语音识别引擎联合使用,以生成带有说话人归属的转录文本。为实现这一目标,我们采用了一个用户友好的基于Web的界面,使用所选配置处理音频和视频输入。
引用
@article{arxiv.2409.05750,
title = {A Toolkit for Joint Speaker Diarization and Identification with Application to Speaker-Attributed ASR},
author = {Giovanni Morrone and Enrico Zovato and Fabio Brugnara and Enrico Sartori and Leonardo Badino},
journal= {arXiv preprint arXiv:2409.05750},
year = {2024}
}
备注
Show and Tell paper. Presented at Interspeech 2024