中文

一种基于对比语言-音频预训练的无参考语言查询音频源分离度量

声音 2025-01-07 v2 音频与语音处理

摘要

语言查询音频源分离(LASS)旨在根据文本查询引导分离音频源,通常使用基于信号失真比(SDR)的度量来客观衡量分离音频的质量。然而,基于 SDR 的度量需要参考信号,这在现实场景中通常难以获得。此外,在 LASS 中,基于 SDR 的度量未能有效考虑文本查询的内容信息。本文引入了一种使用对比语言-音频预训练(CLAP)模块的无参考评估度量,称为 CLAPScore,它衡量分离音频与文本查询之间的语义相似性。与 SDR 不同,所提出的 CLAPScore 度量基于文本查询的内容信息评估分离音频的质量,无需参考信号。实验表明,与 SDR 度量相比,CLAPScore 提供了对分离音频与文本查询语义相关性的有效评估,为 LASS 系统的性能评估提供了一种替代方案。评估代码已公开。

关键词

引用

@article{arxiv.2407.04936,
  title  = {A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining},
  author = {Feiyang Xiao and Jian Guan and Qiaoxi Zhu and Xubo Liu and Wenbo Wang and Shuhan Qi and Kejia Zhang and Jianyuan Sun and Wenwu Wang},
  journal= {arXiv preprint arXiv:2407.04936},
  year   = {2025}
}

备注

Accepted by DCASE 2024 Workshop. GitHub: https://github.com/LittleFlyingSheep/CLAPScore_for_LASS