中文

TICL:基于文本嵌入的 KNN 用于语音情境学习 unlocks 语音识别大型多模态模型的能力

音频与语音处理 2025-09-18 v1 人工智能 计算与语言 机器学习 多媒体

摘要

语音基础模型最近展示出进行语音情境学习(Speech In-Context Learning, SICL)的能力。选择有效的情境示例对 SICL 性能至关重要,但选择方法仍未得到充分探索。本文提出一种基于文本嵌入的 KNN 用于 SICL(TICL),这是一种简约的管道,利用语义上下文来增强无需微调的大型多模态模型的语音识别能力。在包括accented English、多语言语音和儿童语音等具有挑战性的自动语音识别任务中,我们的方法使模型在零样本性能之上实现了最高可达 84.7% 的相对 WER 降低。我们进行了消化实验,以展示该方法的鲁棒性和效率。

关键词

引用

@article{arxiv.2509.13395,
  title  = {TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models},
  author = {Haolong Zheng and Yekaterina Yegorova and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2509.13395},
  year   = {2025}
}