DDFAD:面向音频数据的Dataset Distillation框架
声音
2024-07-23 v1 人工智能
数据库
音频与语音处理
摘要
深度神经网络(DNN)在众多应用中取得了显著的成功。DNN的卓越性能很大程度上归功于大规模高质量训练数据的可用性。然而,处理如此庞大的训练数据需要巨大的计算和存储资源。数据提炼是一种有前景的解决方案,能够将大型数据集压缩为较小的提炼数据集。在提炼数据集上训练的模型可实现与在完整数据集上训练的模型相当的性能。尽管数据提炼在图像数据上已得到验证,但尚无人探索音频数据的提炼问题。本文首次提出面向音频数据的Dataset Distillation框架(DDFAD)。具体而言,我们首先提出了基于Fused Differential MFCC(FD-MFCC)的特征提取方法,用于音频数据。随后,通过匹配训练轨迹提炼方法对FD-MFCC进行提炼。最后,我们提出一种基于Griffin-Lim算法的音频信号重建算法,用于从提炼的FD-MFCC重建音频信号。广泛实验表明DDFAD在各种音频数据集上均有效。此外,我们展示了DDFAD在诸多应用中具有潜在的应用前景,如持续学习和神经网络架构搜索。
关键词
引用
@article{arxiv.2407.10446,
title = {DDFAD: Dataset Distillation Framework for Audio Data},
author = {Wenbo Jiang and Rui Zhang and Hongwei Li and Xiaoyuan Liu and Haomiao Yang and Shui Yu},
journal= {arXiv preprint arXiv:2407.10446},
year = {2024}
}