面向大规模情境零样本插槽填充的 SpeechLLMs
计算与语言
2025-10-20 v1 机器学习
摘要
插槽填充是口语理解 (SLU) 中的关键子任务,传统上作为语音识别后接一个或多个自然语言理解 (NLU) 组件的级联方式实现。近期出现的基于语音的大型语言模型 (speechLLMs),其集成了语音和文本基础模型,为以更统一、生成式和遵循指令的方式完成语音理解任务提供了新途径,同时以零样本能力实现数据和计算效率,泛化到未见过的插槽标签。我们通过构建该任务的经验上限、识别性能、鲁棒性和泛化性之间的差距,并提出改进训练数据、架构和训练策略的措施来缩小与上限结果之间的差距。我们展示,这些措施每项都显著提升了性能,同时强调实际挑战并提供经验性指导和见解,帮助利用这些新兴模型。
引用
@article{arxiv.2510.15851,
title = {SpeechLLMs for Large-scale Contextualized Zero-shot Slot Filling},
author = {Kadri Hacioglu and Manjunath K E and Andreas Stolcke},
journal= {arXiv preprint arXiv:2510.15851},
year = {2025}
}
备注
13 pages, EMNLP 2025