TASLA:基于多层聚合的文本对齐语音标记
声音
2025-10-17 v1
摘要
我们提出了文本对齐语音标记与多层聚合(Text-Aligned Speech Tokens with Multiple Layer-Aggregation,TASLA)框架,旨在解决在低帧率且文本对齐的条件下,单一来源语音标记在重建过程中可能丢失声学细节的问题。本文进一步阐述了不同的编码器层如何协作以捕获用于标记的全面声学特征。以前的工作TASTE提出了文本对齐语音标记框架,这是一种面向语言模型的架构,但在捕获声学细节方面存在困难。我们通过两个组件来解决这一权衡:多层动态注意(Multi-Layer Dynamic Attention,MLDA),它使每个文本位置能够自适应地混合来自冻结语音编码器的浅层/深层特征;以及有限标量量化(Finite Scalar Quantization,FSQ),这是一种具有平滑优化的简单逐维离散化。在约2.62 Hz(标记/秒)的帧率下,TASLA在原域(LibriSpeech)和外域(EXPRESSO、Voxceleb)数据集上均一致地改善了抑扬顿音,并在质量上与TASTE持平。我们进一步表明,动态层混合与谱通量相关,解释了为何在极端特征压缩下,MLDA能够在低帧率下保持抑扬顿音。
引用
@article{arxiv.2510.14934,
title = {TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation},
author = {Ming-Hao Hsu and Liang-Hsuan Tseng and Hung-yi Lee and Zhizheng Wu},
journal= {arXiv preprint arXiv:2510.14934},
year = {2025}
}