中文

PAST:语音-声学语音标记器

声音 2025-06-05 v2 计算与语言 机器学习 音频与语音处理

摘要

我们提出PAST,一个新颖的端到端框架,联合建模语音信息和信号重构,无需外部预训练模型。不同于以往依赖预训练自监督模型的做法,PAST采用监督语音数据,直接通过辅助任务将领域知识集成到标记化过程中。此外,我们引入PAST的可流式、因果变体,实现实时语音应用。实验结果表明,PAST在常见评估指标上超越现有基准标记器,包括语音表示和语音重构。值得注意的是,PAST在作为语音语言模型的语音表示时也表现出色,进一步凸显其作为 spoken language generation 基础模型的有效性。为促进进一步研究,我们发布完整实现。关于代码、模型检查点和样本,请参见:https://pages.cs.huji.ac.il/adiyoss-lab/PAST

关键词

引用

@article{arxiv.2505.14470,
  title  = {PAST: Phonetic-Acoustic Speech Tokenizer},
  author = {Nadav Har-Tuv and Or Tal and Yossi Adi},
  journal= {arXiv preprint arXiv:2505.14470},
  year   = {2025}
}