一种基于对比语言-音频预训练的无参考语言查询音频源分离度量
声音
2025-01-07 v2 音频与语音处理
摘要
语言查询音频源分离(LASS)旨在根据文本查询引导分离音频源,通常使用基于信号失真比(SDR)的度量来客观衡量分离音频的质量。然而,基于 SDR 的度量需要参考信号,这在现实场景中通常难以获得。此外,在 LASS 中,基于 SDR 的度量未能有效考虑文本查询的内容信息。本文引入了一种使用对比语言-音频预训练(CLAP)模块的无参考评估度量,称为 CLAPScore,它衡量分离音频与文本查询之间的语义相似性。与 SDR 不同,所提出的 CLAPScore 度量基于文本查询的内容信息评估分离音频的质量,无需参考信号。实验表明,与 SDR 度量相比,CLAPScore 提供了对分离音频与文本查询语义相关性的有效评估,为 LASS 系统的性能评估提供了一种替代方案。评估代码已公开。
引用
@article{arxiv.2407.04936,
title = {A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining},
author = {Feiyang Xiao and Jian Guan and Qiaoxi Zhu and Xubo Liu and Wenbo Wang and Shuhan Qi and Kejia Zhang and Jianyuan Sun and Wenwu Wang},
journal= {arXiv preprint arXiv:2407.04936},
year = {2025}
}
备注
Accepted by DCASE 2024 Workshop. GitHub: https://github.com/LittleFlyingSheep/CLAPScore_for_LASS