SAM Audio Judge:用于音频分离感知评估的统一多模态框架
音频与语音处理
2026-01-28 v1 人工智能
摘要
性能评估仍然是音频分离中的一个复杂挑战,现有的评估指标常常与人类感知不一致、粒度粗糙,并且依赖于真实信号。另一方面,主观听音测试仍然是现实世界评估的黄金标准,但它们昂贵、耗时且难以扩展。本文针对无需人工干预即可评估音频分离的自动化系统日益增长的需求。所提出的评估指标SAM Audio Judge (SAJ) 是一个多模态细粒度无参考客观指标,与人类感知高度一致。SAJ支持三个音频领域(语音、音乐和一般声音事件)和三种提示输入(文本、视觉和跨度),涵盖四个不同的评估维度(召回率、精确率、忠实度和总体)。SAM Audio Judge还在数据过滤、大型数据集的伪标签生成以及音频分离模型的重排序中显示出潜在的应用前景。我们在以下网址发布代码和预训练模型:https://github.com/facebookresearch/sam-audio。
引用
@article{arxiv.2601.19702,
title = {SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation},
author = {Helin Wang and Bowen Shi and Andros Tjandra and John Hoffman and Yi-Chiao Wu and Apoorv Vyas and Najim Dehak and Ann Lee and Wei-Ning Hsu},
journal= {arXiv preprint arXiv:2601.19702},
year = {2026}
}