从音频到符号编码
声音
2023-02-28 v1 信息检索
机器学习
音频与语音处理
摘要
自动音乐转录(AMT)旨在将原始音频转换为符号音乐表示。作为音乐信息检索(MIR)的一个基础问题,AMT 即使对训练有素的人类专家而言也被视为困难任务,原因在于声学信号中多个谐波的重叠。另一方面,语音识别作为自然语言处理中最受欢迎的任务之一,旨在将人类口语翻译为文本。基于 AMT 与语音识别的相似本质(二者均处理将音频信号翻译为符号编码的任务),本文探究了一种通用神经网络架构是否可能同时适用于这两项任务。在本文中,我们介绍了构建于当前最优的 Onsets and Frames 之上的新神经网络架构,并比较了其多种变体在 AMT 任务上的性能。我们还在语音识别任务上测试了我们的架构。对于 AMT,我们的模型相比使用最优架构训练的模型能够产生更好的结果;然而,尽管类似架构能够在语音识别任务上训练,但相比其他任务专用模型并未产生非常理想的结果。
引用
@article{arxiv.2302.13401,
title = {From Audio to Symbolic Encoding},
author = {Shenli Yuan and Lingjie Kong and Jiushuang Guo},
journal= {arXiv preprint arXiv:2302.13401},
year = {2023}
}