中文

低延迟推理中的知识提升

机器学习 2024-07-26 v3 声音 音频与语音处理

摘要

面向 low-latency、streaming 应用的模型可能从 larger 模型的知识 capacity 中受益,但由于 resource 限制,边缘设备无法运行这些模型。一种可能的解决方案是从运行在远程地的大模型在 inference 时将 hints 传输到运行在设备上的 small 模型。然而,这会产生 communication delay,以至于打破 real-time 要求,且不能保证 both models 将在同一数据上同一时间 operate。我们提出了知识提升 (knowledge boosting),这是一种新颖的技术,允许 large model 在 inference 时 operate on time-delayed input,同时仍然 boost small model performance。我们使用一个处理 8 ms 数据块的 streaming 神经网络,对不同的 speech separation 和 enhancement 任务进行评估,communication delays 最多可达六个数据块或 48 ms。我们的结果显示,性能差距较大的情景中获得更大的提升,表明该方法对于 large-small model collaboration for low-latency applications 具有前景。代码、数据集和音频样本可在 https://knowledgeboosting.cs.washington.edu/ 查找。

关键词

引用

@article{arxiv.2407.11055,
  title  = {Knowledge boosting during low-latency inference},
  author = {Vidya Srinivas and Malek Itani and Tuochao Chen and Sefik Emre Eskimez and Takuya Yoshioka and Shyamnath Gollakota},
  journal= {arXiv preprint arXiv:2407.11055},
  year   = {2024}
}

备注

Accepted by Interspeech 2024