中文

无监督与监督语义语音标记的比较:儿童语音识别案例研究

音频与语音处理 2025-12-04 v1

摘要

离散语音标记因其存储效率以及与大型语言模型(LLM)的集成而受到关注。它们通常分为声学标记和语义标记,后者在自动语音识别(ASR)中更具优势。传统上,无监督 K-means 聚类被用于从语音基础模型(SFMs)中提取语义语音标记。最近,监督方法如通过 ASR 损失训练的有限标量量化(FSQ)已出现用于语音生成。两种方法均利用预训练的 SFMs,使低资源任务(如儿童 ASR)受益。本文系统比较了监督与无监督语义语音标记在儿童 ASR 中的表现。结果表明,监督方法不仅优于无监督方法,甚至意外地超越了连续表征,并且在超低比特率设置下仍表现良好。这些发现突显了监督语义标记的优势,并为改进离散语音标记化提供了见解。

关键词

引用

@article{arxiv.2512.03301,
  title  = {Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR},
  author = {Mohan Shi and Natarajan Balaji Shankar and Kaiyuan Zhang and Zilai Wang and Abeer Alwan},
  journal= {arXiv preprint arXiv:2512.03301},
  year   = {2025}
}

备注

ASRU-AI4CSL