TASTE:面向口语建模的文本对齐语音分词与嵌入
计算与语言
2026-02-06 v3 声音
音频与语音处理
摘要
近期研究致力于构建能够倾听又能讲话的口语语言模型(SLM),以实现更自然的人类-LLM交互。联合语音-文本建模是实现这一目标的有前景的方向。然而,近期语音标记在联合建模中的效果仍未得到充分探索。为此,我们提出文本对齐语音分词与嵌入(TASTE)方法,通过在分词阶段将语音标记与相应文本转录对齐,直接解决模态间的鸿沟。我们提出一种方法,可通过基于注意力的聚合机制实现此目标,并以语音重建为训练目标。我们进行了大量实验,表明TASTE能够保留关键的语音语言信息,同时大幅降低标记序列长度。采用TASTE后,可通过在预训练文本LLM上应用低秩适配(Low-Rank Adaptation)进行联合口语语言建模。实验结果表明,基于TASTE的SLM在SALMON和StoryCloze上表现与先前工作相当;在语音续写任务中显著优于其他预训练SLM,无论是主观评估还是客观评估都表现出色。据我们所知,TASTE是首个利用重建目标实现语音分词与嵌入自动学习、且适用于口语语言建模的端到端方法。我们的演示、代码和模型已在 https://mtkresearch.github.io/TASTE-SpokenLM.github.io 提供。
引用
@article{arxiv.2504.07053,
title = {TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling},
author = {Liang-Hsuan Tseng and Yi-Chang Chen and Kuan-Yi Lee and Da-Shan Shiu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2504.07053},
year = {2026}
}
备注
ICLR 2026