TICL:基于文本嵌入的 KNN 用于语音情境学习 unlocks 语音识别大型多模态模型的能力
音频与语音处理
2025-09-18 v1 人工智能
计算与语言
机器学习
多媒体
摘要
语音基础模型最近展示出进行语音情境学习(Speech In-Context Learning, SICL)的能力。选择有效的情境示例对 SICL 性能至关重要,但选择方法仍未得到充分探索。本文提出一种基于文本嵌入的 KNN 用于 SICL(TICL),这是一种简约的管道,利用语义上下文来增强无需微调的大型多模态模型的语音识别能力。在包括accented English、多语言语音和儿童语音等具有挑战性的自动语音识别任务中,我们的方法使模型在零样本性能之上实现了最高可达 84.7% 的相对 WER 降低。我们进行了消化实验,以展示该方法的鲁棒性和效率。
引用
@article{arxiv.2509.13395,
title = {TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models},
author = {Haolong Zheng and Yekaterina Yegorova and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:2509.13395},
year = {2025}
}