中文

TESU-LLM:通过统一编码器对齐训练无语音的语音-LLM

计算与语言 2025-06-10 v1 人工智能 机器学习 声音 音频与语音处理

摘要

最近的语音增强型语言模型进展显示出在构建智能语音助手方面具有前景潜力。然而,大多数现有方法依赖大规模的语音-文本配对数据和大量计算资源,这在可扩展性和可及性方面存在挑战。本文提出了 \textbf{TESU-LLM},一种新型框架,使仅使用文本数据即可训练具备语音能力的语言模型。我们的关键洞察是利用统一编码器将语义等效的文本和语音输入映射到共享潜在空间。通过将编码器输出与 LLM 的嵌入空间通过轻量级投影网络对齐,我们使模型能够从仅限文本的监督信息 generalizes 到语音推理。尽管仅在文本上训练,TESU-LLM 在various语音相关基准测试上实现了与使用大规模多模态数据集和大量计算资源训练的基线方法相当的性能。这些结果凸显了该方法的有效性和效率,为构建无语音数据的语音 LLM 提供了可扩展的路径。

关键词

引用

@article{arxiv.2506.06343,
  title  = {TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment},
  author = {Taesoo Kim and Jong Hwan Ko},
  journal= {arXiv preprint arXiv:2506.06343},
  year   = {2025}
}