MOSA:用于跨模态音乐处理的带有语义标注的音乐动作数据集
声音
2024-06-11 v1 人工智能
音频与语音处理
摘要
在跨模态音乐处理中,视觉、听觉和语义内容之间的转换带来了新的可能性与挑战。这种转换方案的构建依赖于具有完善数据基础设施的基准语料库。特别是,大规模跨模态数据集的构建面临重大挑战。在本文中,我们提出了 MOSA(带有语义标注的音乐动作)数据集,该数据集包含高质量的 3D 动作捕捉数据、对齐的音频录音,以及 23 位专业音乐家的 742 场专业音乐表演的逐音符语义标注,涵盖音高、节拍、乐句、力度、发音和和声,包含超过 30 小时和 57 万个音符的数据。据我们所知,这是迄今为止最大的带有音符级标注的跨模态音乐数据集。为了展示 MOSA 数据集的用法,我们提出了几项创新的跨模态音乐信息检索 (MIR) 和音乐内容生成任务,包括从音频、视频和动作数据中检测节拍、强拍、乐句和表现性内容,以及根据给定的音乐音频生成音乐家的身体动作。数据集和代码随本出版物一起提供 (https://github.com/yufenhuang/MOSA-Music-mOtion-and-Semantic-Annotation-dataset)。
引用
@article{arxiv.2406.06375,
title = {MOSA: Music Motion with Semantic Annotation Dataset for Cross-Modal Music Processing},
author = {Yu-Fen Huang and Nikki Moran and Simon Coleman and Jon Kelly and Shun-Hwa Wei and Po-Yin Chen and Yun-Hsin Huang and Tsung-Ping Chen and Yu-Chia Kuo and Yu-Chi Wei and Chih-Hsuan Li and Da-Yu Huang and Hsuan-Kai Kao and Ting-Wei Lin and Li Su},
journal= {arXiv preprint arXiv:2406.06375},
year = {2024}
}
备注
IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2024. 14 pages, 7 figures. Dataset is available on: https://github.com/yufenhuang/MOSA-Music-mOtion-and-Semantic-Annotation-dataset/tree/main and https://zenodo.org/records/11393449