中文

SoundSculpt:方向与语义驱动的 Ambisonic 目标声场提取

音频与语音处理 2025-06-03 v1 机器学习 声音

摘要

本文介绍了 SoundSculpt,一种旨在从 ambisonic 录音中提取目标声场的神经网络。SoundSculpt 采用 ambisonic 输入-ambisonic 输出架构,并以空间信息(例如,通过指向沉浸式视频获得的目标方向)和语义嵌入(例如,源自图像分割和字幕生成)为条件。在合成与真实的 ambisonic 混合信号上进行训练和评估后,SoundSculpt 与各种信号处理基线相比展现出优越的性能。我们的结果进一步表明,虽然仅使用空间条件即可生效,但在存在空间上靠近目标的次要声源的场景中,空间与语义信息的结合是有益的。此外,我们比较了使用文本编码器从目标声音的文本描述中导出的两种不同语义嵌入。

关键词

引用

@article{arxiv.2506.00273,
  title  = {SoundSculpt: Direction and Semantics Driven Ambisonic Target Sound Extraction},
  author = {Tuochao Chen and D Shin and Hakan Erdogan and Sinan Hersek},
  journal= {arXiv preprint arXiv:2506.00273},
  year   = {2025}
}