中文

通过顺承预测声码器标记来表示语音

计算与语言 2025-08-18 v1 声音 音频与语音处理

摘要

我们提出 AuriStream,这是一个受生物学启发的模型,通过受人类听觉处理层级结构启发的两阶段框架来编码语音。第一阶段将原始音频转换为基于人类毛细血管的时频表示,从中提取离散的声码器标记。第二阶段对声码器标记应用自回归序列模型。AuriStream 学习到有意义的音素和词表示,以及最先进的词汇语义。AuriStream 在多样化的下游 SUPERB 语音任务上表现出竞争力。补充 AuriStream 强大的表示能力的是,它生成可在频谱图空间中可视化并解码回音频的音频续写,为洞察模型预测提供了见解。总之,我们提出了一个用于语音表示学习的两阶段框架,以推动开发更类似人类的模型,这些模型能够高效地处理多种语音任务。

关键词

引用

@article{arxiv.2508.11598,
  title  = {Representing Speech Through Autoregressive Prediction of Cochlear Tokens},
  author = {Greta Tuckute and Klemen Kotar and Evelina Fedorenko and Daniel L. K. Yamins},
  journal= {arXiv preprint arXiv:2508.11598},
  year   = {2025}
}