中文

SAM Audio:音频中的 Segment Anything

音频与语音处理 2025-12-24 v1 计算机视觉与模式识别

摘要

通用音频源分离是多模态 AI 系统实现感知与推理能力的关键技术。尽管近年来取得了显著进展,现有分离模型要么针对特定领域设计,要么仅支持固定类别(如语音或音乐),要么在可控性上受限,仅支持单一提示模态(如文本)。本文提出 SAM Audio,一个面向通用音频分离的基础模型,统一了文本、视觉和时间跨度提示于单一框架之内。基于扩散变换器架构,SAM Audio 采用流匹配技术在大规模音频数据上进行训练,涵盖语音、音乐及通用声音,可灵活地通过语言描述、视觉掩码或时间跨度分离目标源。该模型在广泛的基准测试中实现了领先性能,包括野外及专业制作音频中的通用声音、语音、音乐及乐器分离,显著优于先前的通用及专用系统。此外,我们引入了一个新的真实世界分离基准,包含人工标注的多模态提示,并引入一个参考无关的评估模型,与人类判断高度相关。

关键词

引用

@article{arxiv.2512.18099,
  title  = {SAM Audio: Segment Anything in Audio},
  author = {Bowen Shi and Andros Tjandra and John Hoffman and Helin Wang and Yi-Chiao Wu and Luya Gao and Julius Richter and Matt Le and Apoorv Vyas and Sanyuan Chen and Christoph Feichtenhofer and Piotr Dollár and Wei-Ning Hsu and Ann Lee},
  journal= {arXiv preprint arXiv:2512.18099},
  year   = {2025}
}