中文

面向数据高效查询的语义一致性声音分离数据集

声音 2026-02-02 v1 人机交互

摘要

查询式通用声音分离是智能听觉系统的基本任务,旨在从混合信号中隔离特定来源。尽管近期进展取得显著成果,现有方法仍在复杂声学场景中存在残余干扰。这一性能限制主要源于数据瓶颈:野外数据集包含弱标签且事件严重共现。这些缺陷会导致模型学习到背景噪声与目标类别之间的伪相关,而非稳健的声学特征。为此,我们提出了一种自动化流程,通过从野外数据集中挖掘高纯度单事件片段并采用语义一致性合成协议来消除事件共现。利用该流程,我们构建了 Hive,一个包含 2400 小时原始音频的高质量合成数据集。实验结果表明,与在约 500 倍于 Hive 数据集大小的 SOTA 模型 SAM-Audio 相比,某些开源模型在 Hive 上训练可实现竞争的分离精度和感知质量。此外,这些模型在离群分布评估基准上表现出显著的零样本泛化能力。这些发现表明,优先保证监督信号的纯净性可实现显著的数据效率,为以更低的计算成本训练稳健的听觉基础模型提供了新范式。代码和数据集已在 https://shandaai.github.io/Hive 上提供。

关键词

引用

@article{arxiv.2601.22599,
  title  = {A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation},
  author = {Kai Li and Jintao Cheng and Chang Zeng and Zijun Yan and Helin Wang and Zixiong Su and Bo Zheng and Xiaolin Hu},
  journal= {arXiv preprint arXiv:2601.22599},
  year   = {2026}
}

备注

Technical Report