机器学习:音频修复过程中的挑战、局限与兼容性问题
声音
2021-09-08 v1 机器学习
音频与语音处理
摘要
本文探讨了利用机器学习网络修复降质与压缩语音音频的用途。项目意图是基于语音数据构建新的训练模型,以学习由有损压缩导致的数据丢失以及分辨率丢失所引入的压缩伪影失真特征,所用现有算法为 SEGAN: Speech Enhancement Generative Adversarial Network 中提出的算法。该模型生成的生成器随后用于修复降质语音音频。本文详述了在使用已弃用代码时所出现的兼容性与操作性问题的考察,这些问题阻碍了训练模型的成功开发。本文进一步审视了机器学习当前现状下的挑战、局限与兼容性。
引用
@article{arxiv.2109.02692,
title = {Machine Learning: Challenges, Limitations, and Compatibility for Audio Restoration Processes},
author = {Owen Casey and Rushit Dave and Naeem Seliya and Evelyn R Sowells Boone},
journal= {arXiv preprint arXiv:2109.02692},
year = {2021}
}
备注
6 pages, 2 figures