AudioScene:将对象-事件音频集成到3D场景中
声音
2025-12-10 v1 人工智能
音频与语音处理
摘要
音频分析技术的快速发展凸显了其在人机交互、环境监测和公共安全等领域的巨大潜力;然而,现有音频数据集往往缺乏空间语境。为此,我们提出两种新型音频空间场景数据集:AudioScanNet和AudioRoboTHOR,旨在探索3D环境中的音频条件任务。通过将音频剪辑与空间对齐的3D场景集成,本数据集支持研究音频信号如何与空间语境相互作用。为将音频事件关联到相应的空间信息,我们利用大语言模型的常识推理能力,并辅以严格的人类验证。这一方法相较于纯手动标注具有更好的可扩展性,同时保持高水平的准确性、完整性和多样性,通过跨标注者一致性和两个基准任务(基于音频的3D视觉定位和基于音频的机器人零样本导航)进行量化评估。结果揭示了当前音频中心方法的局限性,凸显了本数据集在推动音频导向空间学习方面的实际挑战与重要性。
引用
@article{arxiv.2512.07845,
title = {AudioScene: Integrating Object-Event Audio into 3D Scenes},
author = {Shuaihang Yuan and Congcong Wen and Muhammad Shafique and Anthony Tzes and Yi Fang},
journal= {arXiv preprint arXiv:2512.07845},
year = {2025}
}