人工智能与速度估计:综述
声音
2024-01-02 v1 人工智能
音频与语音处理
摘要
本文作者旨在探讨人工智能 (AI) 如何被用于增进我们对音乐创作关键方面——音乐速度——的理解,并提升大规模估计音乐速度的能力。速度对音乐创作的核心重要性体现在其被用于表达特定情感 (Eerola and Vuoskoski 2013)、暗示特定音乐风格 (Li and Chan 2011)、影响表现力感知 (Webster and Weir 2005) 以及调节随音乐节奏身体律动的冲动 (Burger et al. 2014)。传统的速度估计方法通常检测反映音乐潜在节奏结构的信号周期性,常采用振幅包络的某种自相关形式 (Lartillot and Toiviainen 2007)。最近,利用卷积或循环神经网络 (CNNs, RNNs) 处理音频信号频谱表示的基于 AI 的方法在准确性上取得了显著改进 (Aarabi and Peeters 2022)。常见的基于 AI 的技术包括基于概率的方法(例如贝叶斯方法、隐马尔可夫模型 (HMM))、分类与统计学习(例如支持向量机 (SVM))以及人工神经网络 (ANNs)(例如自组织映射 (SOMs)、CNNs、RNNs、深度学习 (DL))。本文旨在概述一些更常见的基于 AI 的速度估计算法,并阐明各自显著的益处和潜在缺陷。同时也考虑了 AI 在该领域的一般局限性,以及此类方法解释速度感知固有特异性的能力,即基于 AI 的方法在多大程度上能够像人类一样思考和行动。
引用
@article{arxiv.2401.00209,
title = {AI and Tempo Estimation: A Review},
author = {Geoff Luck},
journal= {arXiv preprint arXiv:2401.00209},
year = {2024}
}
备注
9 pages