深度学习的通用操作流程:无约束最优设计视角
机器学习
2021-01-01 v1 声音
音频与语音处理
摘要
深度学习(DL)因其在提取高度抽象表示和学习非常复杂函数方面的功效,已在图像、视频和语音处理中带来显著突破。然而,关于如何将其用于实际用例的操作流程却鲜有报道。本文旨在从无约束最优设计的视角提出一种深度学习的通用操作流程,以解决该问题,其动机是出于消除使用 DL 障碍的简单意图,尤其面向那些初学但渴望使用它的科学家或工程师。我们提出的流程包含七个步骤,分别为:项目/问题陈述、数据收集、架构设计、参数初始化、定义损失函数、计算最优参数以及推理。遵循该流程,我们构建了一个多流端到端说话人确认系统,其中输入语音片段由多个并行流在不同频率范围内处理,从而因特征的多样性使声学建模更为鲁棒。使用 VoxCeleb 数据集训练,实验结果验证了所提操作流程的有效性,并表明我们的多流框架优于单流基线,最小决策代价函数(minDCF)相对降低 20%。
引用
@article{arxiv.2012.15391,
title = {Generalized Operating Procedure for Deep Learning: an Unconstrained Optimal Design Perspective},
author = {Shen Chen and Mingwei Zhang and Jiamin Cui and Wei Yao},
journal= {arXiv preprint arXiv:2012.15391},
year = {2021}
}
备注
5 pages, 4 figures, 1 table