RepAugment:面向呼吸音分类的输入无关表示级数据增强
声音
2024-05-07 v1 人工智能
音频与语音处理
摘要
近期的人工智能进展使其作为医疗助手的部署变得更加普遍。尽管来自大规模视觉和音频数据集的预训练模型已明确证明可推广至此任务,但 surprisingly,没有研究探索预训练语音模型——这些模型作为源自人类的声音,直观上应与肺音更接近。本文探讨了预训练语音模型用于呼吸音分类的有效性。我们发现语音与肺音样本之间存在特征描述差距为 bridging this gap,数据增强是必不可少的。然而,最广泛使用的音频和语音数据增强技术SpecAugment需要2维频谱图格式,无法应用于预训练语音波形模型。为此,我们提出RepAugment,这是一种输入无关的表示级数据增强技术,后于SpecAugment,也适用于呼吸音分类的波形预训练模型。实验结果表明,我们的方法优于SpecAugment,显著提高了少数疾病类别的准确率,提升幅度可达7.14%。
引用
@article{arxiv.2405.02996,
title = {RepAugment: Input-Agnostic Representation-Level Augmentation for Respiratory Sound Classification},
author = {June-Woo Kim and Miika Toikkanen and Sangmin Bae and Minseok Kim and Ho-Young Jung},
journal= {arXiv preprint arXiv:2405.02996},
year = {2024}
}
备注
Accepted EMBC 2024