中文

利用图像嵌入的零样本音频分类

声音 2022-06-13 v1 机器学习 音频与语音处理

摘要

监督学习方法在存在大量标注数据时可解决给定问题。然而,获取覆盖所有目标类别的数据集通常需要人工标注,这昂贵且耗时。零样本学习模型能够利用语义信息对未见概念进行分类。本研究通过使用非线性声学-语义投影,将图像嵌入作为侧信息引入零样本音频分类。我们从Open Images数据集中提取语义图像表示,并使用不同域(图像、音频和文本)的语义信息在AudioSet的音频子集上评估模型性能。我们证明了图像嵌入可用作语义信息来执行零样本音频分类。实验结果表明,图像与文本嵌入在单独使用和联合使用时均表现出相似性能。我们额外从测试样本计算语义声学嵌入,以提供性能上限。结果表明,分类性能对测试类与训练类之间的语义关系高度敏感,当所见类与未见类语义相似时,文本与图像嵌入可达到语义声学嵌入的水平。

关键词

引用

@article{arxiv.2206.04984,
  title  = {Zero-Shot Audio Classification using Image Embeddings},
  author = {Duygu Dogan and Huang Xie and Toni Heittola and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2206.04984},
  year   = {2022}
}

备注

Accepted to the European Signal Processing Conference (EUSIPCO) 2022