中文

SemanticAC:语义辅助的音频分类框架

声音 2023-02-14 v1 人工智能 音频与语音处理

摘要

本文中,我们提出SemanticAC,一种用于音频分类的语义辅助框架,以更好地利用语义信息。不同于将类标签视为离散向量的传统音频分类方法,我们采用语言模型从标签中提取丰富语义,并优化音频信号与其标签之间的语义一致性。我们验证了来自标签的简单文本信息与先进的预训练模型能够提供更丰富的语义监督从而获得更优性能。具体而言,我们设计了一个文本编码器来从标签的文本扩展中捕获语义信息。随后我们通过音频编码器与相似度计算模块将音频信号映射以对齐相应类标签的语义,从而强制语义一致性。在ESC-50与US8K两个音频数据集上的大量实验表明,我们所提方法持续优于对比的音频分类方法。

关键词

引用

@article{arxiv.2302.05940,
  title  = {SemanticAC: Semantics-Assisted Framework for Audio Classification},
  author = {Yicheng Xiao and Yue Ma and Shuyan Li and Hantao Zhou and Ran Liao and Xiu Li},
  journal= {arXiv preprint arXiv:2302.05940},
  year   = {2023}
}