利用图像嵌入的零样本音频分类
声音
2022-06-13 v1 机器学习
音频与语音处理
摘要
监督学习方法在存在大量标注数据时可解决给定问题。然而,获取覆盖所有目标类别的数据集通常需要人工标注,这昂贵且耗时。零样本学习模型能够利用语义信息对未见概念进行分类。本研究通过使用非线性声学-语义投影,将图像嵌入作为侧信息引入零样本音频分类。我们从Open Images数据集中提取语义图像表示,并使用不同域(图像、音频和文本)的语义信息在AudioSet的音频子集上评估模型性能。我们证明了图像嵌入可用作语义信息来执行零样本音频分类。实验结果表明,图像与文本嵌入在单独使用和联合使用时均表现出相似性能。我们额外从测试样本计算语义声学嵌入,以提供性能上限。结果表明,分类性能对测试类与训练类之间的语义关系高度敏感,当所见类与未见类语义相似时,文本与图像嵌入可达到语义声学嵌入的水平。
引用
@article{arxiv.2206.04984,
title = {Zero-Shot Audio Classification using Image Embeddings},
author = {Duygu Dogan and Huang Xie and Toni Heittola and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2206.04984},
year = {2022}
}
备注
Accepted to the European Signal Processing Conference (EUSIPCO) 2022