具有灵活文本引导定位的自然音频空间化
声音
2025-06-03 v1 人工智能
音频与语音处理
摘要
为了增强沉浸式体验,双耳音频在 AR、VR 和具身 AI 应用中提供了发声物体的空间感知。虽然现有的音频空间化方法通常可以将任何可用的单耳音频映射为双耳音频信号,但它们往往缺乏复杂多对象用户交互环境中所需的灵活和交互式控制。为了解决这个问题,我们提出了一个文本引导音频空间化(TAS)框架,该框架利用灵活的文本提示,并从统一的生成与理解视角评估我们的模型。由于高质量和大规模立体声数据的可用性有限,我们构建了 SpatialTAS 数据集,其中包含 376,000 个模拟的双耳音频样本,以促进我们模型的训练。我们的模型学习由 3D 空间位置和相对位置提示引导的双耳差异,并通过翻转通道音频进行增强。它在模拟和真实录制的数据集上均优于现有方法,展现出卓越的泛化能力和准确度。此外,我们开发了一个基于 Llama-3.1-8B 的评估模型,该模型通过空间推理任务评估我们生成的双耳音频与文本提示之间的空间语义连贯性。结果表明,文本提示提供了灵活且交互式的控制,以生成在空间位置上具有出色质量和语义一致性的双耳音频。数据集可在 \href{https://github.com/Alice01010101/TASU} 获取
引用
@article{arxiv.2506.00927,
title = {In-the-wild Audio Spatialization with Flexible Text-guided Localization},
author = {Tianrui Pan and Jie Liu and Zewen Huang and Jie Tang and Gangshan Wu},
journal= {arXiv preprint arXiv:2506.00927},
year = {2025}
}
备注
Accepted by ACL 2025 main