中文

人工智能与速度估计:综述

声音 2024-01-02 v1 人工智能 音频与语音处理

摘要

本文作者旨在探讨人工智能 (AI) 如何被用于增进我们对音乐创作关键方面——音乐速度——的理解,并提升大规模估计音乐速度的能力。速度对音乐创作的核心重要性体现在其被用于表达特定情感 (Eerola and Vuoskoski 2013)、暗示特定音乐风格 (Li and Chan 2011)、影响表现力感知 (Webster and Weir 2005) 以及调节随音乐节奏身体律动的冲动 (Burger et al. 2014)。传统的速度估计方法通常检测反映音乐潜在节奏结构的信号周期性,常采用振幅包络的某种自相关形式 (Lartillot and Toiviainen 2007)。最近,利用卷积或循环神经网络 (CNNs, RNNs) 处理音频信号频谱表示的基于 AI 的方法在准确性上取得了显著改进 (Aarabi and Peeters 2022)。常见的基于 AI 的技术包括基于概率的方法(例如贝叶斯方法、隐马尔可夫模型 (HMM))、分类与统计学习(例如支持向量机 (SVM))以及人工神经网络 (ANNs)(例如自组织映射 (SOMs)、CNNs、RNNs、深度学习 (DL))。本文旨在概述一些更常见的基于 AI 的速度估计算法,并阐明各自显著的益处和潜在缺陷。同时也考虑了 AI 在该领域的一般局限性,以及此类方法解释速度感知固有特异性的能力,即基于 AI 的方法在多大程度上能够像人类一样思考和行动。

关键词

引用

@article{arxiv.2401.00209,
  title  = {AI and Tempo Estimation: A Review},
  author = {Geoff Luck},
  journal= {arXiv preprint arXiv:2401.00209},
  year   = {2024}
}

备注

9 pages