用于灵长类动物分类与新冠检测的视觉Transformer
声音
2022-12-21 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
我们将视觉Transformer(一种围绕注意力机制构建的深度机器学习模型)应用于原始音频录音的梅尔频谱图表示。在加入基于梅尔的数据增强技术与样本加权后,我们在ComParE21的两个任务(PRS与CCS挑战赛)上取得了可比的性能,优于大多数单模型基线。我们进一步引入了重叠垂直分块,并评估了参数配置的影响。索引术语:音频分类、注意力、梅尔频谱图、不平衡数据集、计算副语言学
引用
@article{arxiv.2212.10093,
title = {Visual Transformers for Primates Classification and Covid Detection},
author = {Steffen Illium and Robert Müller and Andreas Sedlmeier and Claudia-Linnhoff Popien},
journal= {arXiv preprint arXiv:2212.10093},
year = {2022}
}