零样本与少样本声音事件定位与检测
声音
2024-01-19 v2 音频与语音处理
摘要
声音事件定位与检测(SELD)系统估计目标类别集合的到达方向(DOA)与时间激活。基于神经网络(NN)的 SELD 系统在各种目标类别集合上表现良好,但它们仅输出推理前训练好的预设类别的 DOA 与时间激活。为在训练后定制目标类别,我们处理零样本与少样本 SELD 任务,其中使用文本样本或少量音频样本设定新类别。虽然零样本声音分类任务可通过对比语言-音频预训练(CLAP)的嵌入实现,但零样本 SELD 任务需要将活动与 DOA 分配给每个嵌入,尤其在重叠情况下。为处理重叠情况下的分配问题,我们提出 embed-ACCDOA 模型,其被训练为输出逐轨迹的 CLAP 嵌入及对应的活动耦合笛卡尔到达方向(ACCDOA)。在零样本与少样本 SELD 任务的实验评估中,embed-ACCDOA 模型展现出比 CLAP 音频编码器与 DOA 估计模型直接组合更好的位置相关分数。此外,所提 embed-ACCDOA 模型与 CLAP 音频编码器结合零样本或少样本样本的方案,在评估数据集上表现与用完整训练数据训练的官方基线系统相当。
引用
@article{arxiv.2309.09223,
title = {Zero- and Few-shot Sound Event Localization and Detection},
author = {Kazuki Shimada and Kengo Uchida and Yuichiro Koyama and Takashi Shibuya and Shusuke Takahashi and Yuki Mitsufuji and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2309.09223},
year = {2024}
}
备注
5 pages, 4 figures, accepted for publication in IEEE ICASSP 2024