面向设备定向语音检测的自适应知识蒸馏
声音
2025-08-06 v1 人工智能
音频与语音处理
摘要
设备定向语音检测(DDSD)是一项二分类任务,旨在将用户对语音助手(VA)的查询与背景语音或旁侧对话区分开来。这对于实现自然的用户体验至关重要。为此,我们提出利用知识蒸馏(KD)来提升DDSD的准确性,同时确保高效的部署。具体而言,我们引入了一种新颖的自适应KD方法,从ASR大型预训练声学编码器(教师模型)的通用表示中转移知识。我们在(冻结的)教师编码器之上应用了任务特定的适配器,并与学生模型在DDSD任务上联合训练。我们证明,所提出的自适应KD在关键词和非关键词(后续)调用中均优于无蒸馏的学生模型,在等错误率方面分别提升了+26%和+19%。我们还表明,该方法可泛化至transformer和conformer模型架构。
引用
@article{arxiv.2508.02801,
title = {Adaptive Knowledge Distillation for Device-Directed Speech Detection},
author = {Hyung Gun Chi and Florian Pesce and Wonil Chang and Oggi Rudovic and Arturo Argueta and Stefan Braun and Vineet Garg and Ahmed Hussen Abdelaziz},
journal= {arXiv preprint arXiv:2508.02801},
year = {2025}
}
备注
5 pages, 2 figures, Interspeech accepted