MRSAudio:大规模多模态记录空间音频数据集 with refined annotations
声音
2025-10-20 v3
摘要
人类依赖多感官整合来感知空间环境,其中听觉线索使我们能够在三维空间中定位声源。尽管空间音频在沉浸式技术(如VR/AR)中发挥着关键作用,但大多数现有多模态数据集仅提供单声道音频,限制了空间音频生成与理解的发展。为此,我们引入MRSAudio——一个旨在推动空间音频理解与生成研究的大规模多模态空间音频数据集。MRSAudio包含四个独立组成部分:MRSLife、MRSSpeech、MRSMusic和MRSSing,涵盖多样真实场景。数据集包括同步的双耳音频和 ambisonic 音频、外视和内视视频、运动轨迹,以及细粒度注释(如转录文本、音素边界、歌词、乐谱和提示词)。为展示MRSAudio的实用性与多样性,我们建立了五个基础任务:音频空间化、空间文本转语音、空间歌声合成、空间音乐生成和声事件定位与检测。结果表明,MRSAudio实现了高质量的空间建模,支持广泛的空间音频研究。演示及数据集获取链接如下:https://mrsaudio.github.io。
关键词
引用
@article{arxiv.2510.10396,
title = {MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations},
author = {Wenxiang Guo and Changhao Pan and Zhiyuan Zhu and Xintong Hu and Yu Zhang and Li Tang and Rui Yang and Han Wang and Zongbao Zhang and Yuhan Wang and Yixuan Chen and Hankun Xu and Ke Xu and Pengfei Fan and Zhetao Chen and Yanhao Yu and Qiange Huang and Fei Wu and Zhou Zhao},
journal= {arXiv preprint arXiv:2510.10396},
year = {2025}
}
备注
24 pages