中文

一种基于自监督学习且无 ASR 的流利度评分方法

音频与语音处理 2023-03-14 v2

摘要

典型的流利度评分系统通常依赖自动语音识别(ASR)系统获取输入语音中的时间戳,以用于后续流利度相关特征的计算,或直接以端到端方式建模语音流利度。本文描述了一种利用自监督学习(SSL)进行自动流利度评估的新颖无 ASR 方法。具体而言,使用 wav2vec2.0 提取帧级语音特征,随后通过 K-means 聚类为每帧分配伪标签(簇索引)。训练一个基于 BLSTM 的模型,由帧级 SSL 特征及相应簇索引预测句子级流利度分数。所提系统既不需要语音转写也不需要时间戳信息。它是无 ASR 的,并有可能在实践中避免 ASR 误差的影响。在非母语英语数据库上进行的实验结果表明,与先前方法相比,所提方法在“开放回答”场景中显著提升了性能,并在“朗读”场景中匹配了近期报道的性能。

关键词

引用

@article{arxiv.2302.09928,
  title  = {An ASR-free Fluency Scoring Approach with Self-Supervised Learning},
  author = {Wei Liu and Kaiqi Fu and Xiaohai Tian and Shuju Shi and Wei Li and Zejun Ma and Tan Lee},
  journal= {arXiv preprint arXiv:2302.09928},
  year   = {2023}
}

备注

Accepted by ICASSP 2023