低延迟推理中的知识提升
机器学习
2024-07-26 v3 声音
音频与语音处理
摘要
面向 low-latency、streaming 应用的模型可能从 larger 模型的知识 capacity 中受益,但由于 resource 限制,边缘设备无法运行这些模型。一种可能的解决方案是从运行在远程地的大模型在 inference 时将 hints 传输到运行在设备上的 small 模型。然而,这会产生 communication delay,以至于打破 real-time 要求,且不能保证 both models 将在同一数据上同一时间 operate。我们提出了知识提升 (knowledge boosting),这是一种新颖的技术,允许 large model 在 inference 时 operate on time-delayed input,同时仍然 boost small model performance。我们使用一个处理 8 ms 数据块的 streaming 神经网络,对不同的 speech separation 和 enhancement 任务进行评估,communication delays 最多可达六个数据块或 48 ms。我们的结果显示,性能差距较大的情景中获得更大的提升,表明该方法对于 large-small model collaboration for low-latency applications 具有前景。代码、数据集和音频样本可在 https://knowledgeboosting.cs.washington.edu/ 查找。
引用
@article{arxiv.2407.11055,
title = {Knowledge boosting during low-latency inference},
author = {Vidya Srinivas and Malek Itani and Tuochao Chen and Sefik Emre Eskimez and Takuya Yoshioka and Shyamnath Gollakota},
journal= {arXiv preprint arXiv:2407.11055},
year = {2024}
}
备注
Accepted by Interspeech 2024