TACO:基于语义约束音视频共分解的训练-free 声音提示分段
音频与语音处理
2025-05-27 v3 机器学习
图像与视频处理
摘要
大规模预训练的音频和图像模型展现出前所未有的泛化能力,适用于广泛的应用场景。本文聚焦声音提示分段任务,即将与音频信号中听到的声音对应的图像区域进行分段。大多数现有方法通过微调预训练模型或为该任务训练额外模块来解决此问题。我们采用不同的策略:引入一种无需训练的方法,利用非负矩阵分解(NMF)对来自预训练模型的音频和视觉特征进行共分解,以揭示共享的可解释概念。这些概念随后传递给开放词汇分段模型,以获得精确的分段图。通过使用冻结的预训练模型,我们的方法实现了高水平的泛化能力,在无监督声音提示分段方面取得了最新的性能,显著超越了以前的无监督方法。
引用
@article{arxiv.2412.01488,
title = {TACO: Training-free Sound Prompted Segmentation via Semantically Constrained Audio-visual CO-factorization},
author = {Hugo Malard and Michel Olvera and Stephane Lathuiliere and Slim Essid},
journal= {arXiv preprint arXiv:2412.01488},
year = {2025}
}