用于语音通信中早期媒体实时分类的知识蒸馏
声音
2025-07-28 v1 人工智能
多媒体
音频与语音处理
摘要
本文研究了在语音通话初始化阶段交换的早期媒体实时分类的工业场景。我们探索了 state-of-the-art 音频标记模型的应用,并强调了将其应用于早期媒体分类时的一些局限性。虽然大多数现有方法利用卷积神经网络,但我们提出了一种基于梯度提升树的新方法,以满足低资源需求。我们的方法不仅在运行时性能上表现出显著提升,而且展现出相当的准确率。我们表明,利用知识蒸馏和类别聚合技术来训练一个更简单、更小的模型,可以加速语音通话中早期媒体的分类。我们在专有和公开可用的数据集上提供了关于准确率和运行时性能的结果详细分析。我们还报告了在印度一个区域数据中心取得的性能改进案例研究。
引用
@article{arxiv.2410.21478,
title = {Knowledge Distillation for Real-Time Classification of Early Media in Voice Communications},
author = {Kemal Altwlkany and Hadžem Hadžić and Amar Kurić and Emanuel Lacic},
journal= {arXiv preprint arXiv:2410.21478},
year = {2025}
}