中文

基于高斯混合模型的语音说话人分离与自动语音识别

音频与语音处理 2024-09-01 v1 机器学习 声音

摘要

在本研究论文中,我们深入探讨语音说话人分离(Speech Diarization)与自动语音识别(ASR)相关主题。语音说话人分离涉及将音频流中的不同说话人分离出来。通过利用 ASR 转写文本,说话人分离过程旨在依据各说话人独特的音频特征对其话语进行分隔与归类。另一方面,自动语音识别指机器或程序识别口语词和短语并将其转换为机器可读格式的能力。在我们的语音说话人分离方法中,我们利用高斯混合器模型(GMM)来表示语音段。类间距离基于 GMM 参数计算,距离阈值作为停止准则。ASR 需要将未知语音波形转换为相应的书面转写文本。语音信号使用同步算法进行分析,并考虑音高频率。我们的主要目标通常围绕开发一个在语音转写过程中使词错误率(WER)指标最小化的模型展开。

关键词

引用

@article{arxiv.2307.05637,
  title  = {Speech Diarization and ASR with GMM},
  author = {Aayush Kumar Sharma and Vineet Bhavikatti and Amogh Nidawani and Siddappaji and Sanath P and Dr Geetishree Mishra},
  journal= {arXiv preprint arXiv:2307.05637},
  year   = {2024}
}