用于分析音乐演奏视频的深度神经网络方法
计算机视觉与模式识别
2022-05-25 v2 人工智能
机器学习
多媒体
摘要
本文提出一个利用 3D 卷积神经网络(CNN)自动化标注音乐演奏视频中手势的框架。尽管该想法在先前研究中已被提出,本文引入了若干创新:(i) 提出一种新方法,通过批量平衡策略与手势的时空表示来克服类不平衡挑战,并使共存手势的学习成为可能。(ii) 对演奏(吉他演奏)音乐作品过程中生成的 7 类与 18 类手势视频录像进行细致研究。(iii) 探究使用音频特征的可能性。(iv) 将分析扩展至多个视频。与先前工作(本研究 51%,先前 39%)相比,新方法有将手势识别性能显著提升 12%。我们在 7 个超类(72%)、18 个手势/类的集成以及额外视频(75%)上成功验证了所提方法。
引用
@article{arxiv.2205.11232,
title = {Deep Neural Network approaches for Analysing Videos of Music Performances},
author = {Foteini Simistira Liwicki and Richa Upadhyay and Prakash Chandra Chhipa and Killian Murphy and Federico Visi and Stefan Östersjö and Marcus Liwicki},
journal= {arXiv preprint arXiv:2205.11232},
year = {2022}
}