音素 vs. 项目:面向基于 LLM 的语音识别的语音-语言接口探究
音频与语音处理
2026-04-13 v1
摘要
将预训练语音编码器与大语言模型 (LLM) 集成是 ASR 的可行方向,但性能和数据效率依赖于语音-语言接口。常见做法是使用学习型投影器将编码器特征映射到 LLM 嵌入空间,而另一种做法是将离散音素序列暴露给 LLM。使用相同的编码器和 LLM Backbone,我们比较了音素导向和 vanilla 投影器导向的接口在高资源英语和低资源 Tatar 语中的表现。我们还提出一种 BPE-音素接口,将频繁的局部音素模式进行分组,同时保留显式的单词边界提示,以便于音素到 grapheme 生成。LibriSpeech 上,音素导向接口与 vanilla 投影器相当,而 BPE-音素接口实现了进一步的提升。在 Tatar 上,音素导向接口显著优于 vanilla 投影器。我们进一步发现,音素监督可产生音素信息混合接口,强于 vanilla 投影器。
引用
@article{arxiv.2604.09332,
title = {Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR},
author = {Ziwei Li and Lukuang Dong and Saierdaer Yusuyin and Xianyu Zhao and Zhijian Ou},
journal= {arXiv preprint arXiv:2604.09332},
year = {2026}
}
备注
Update after INTERSPEECH2026 submission