基于语音-文本对齐精炼伪音频提示:面向LLM-based语音识别的文本-only领域适应
声音
2026-05-15 v1
摘要
LLM-based自动语音识别模型通过连接音频编码器和LLM实现了强大的性能。然而,语音与转录的配对数据稀缺常常阻碍其适应新领域,使得文本-only领域适应至关重要。现有方法通常依赖单独微调LLM或采用伪音频提示。前者忽略了essential的声学上下文,后者要么在数据稀缺条件下受限于可扩展性,要么仅利用文本特征而忽略音频模组,导致提示表达不足。为此,我们提出一种显式建模语音-文本对齐的增强框架。该方法高效生成高度表达性的伪音频提示,弥合模态鸿沟,实现有效的目标域适应。实验表明,我们的方法优于现有的文本-only方法,提高了整体错误率和词汇表外覆盖率。
引用
@article{arxiv.2605.14340,
title = {Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR},
author = {Ryo Magoshi and Takashi Maekaku and Yusuke Shinohara},
journal= {arXiv preprint arXiv:2605.14340},
year = {2026}
}
备注
Submitted to Interspeech 2026