中文

基于混合LSTM-KAN架构的不平衡数据集呼吸音分类研究

声音 2026-01-08 v1 人工智能 音频与语音处理

摘要

通过听诊采集的呼吸音包含诊断肺部疾病的关键线索。由于细微的声学差异和临床数据集中严重的类别不平衡,这些声音的自动分类面临挑战。本研究探讨了呼吸音分类,重点关注缓解显著的类别不平衡问题。我们提出了一种混合深度学习模型,该模型结合了用于序列特征编码的长短期记忆(LSTM)网络和用于分类的Kolmogorov-Arnold网络(KAN)。该模型与全面的特征提取流程和有针对性的不平衡缓解策略相结合。实验在一个包含六个类别且分布高度倾斜的公共呼吸音数据库上进行。采用了焦点损失、类别特定数据增强和合成少数类过采样技术(SMOTE)来增强少数类别的识别。尽管主导的COPD类别占数据的86%以上,所提出的混合LSTM-KAN模型仍实现了94.6%的总体准确率和0.703的宏平均F1分数。与基线方法相比,少数类别的检测性能有所提高,证明了所提出的架构在不平衡呼吸音分类中的有效性。

关键词

引用

@article{arxiv.2601.03610,
  title  = {Investigation into respiratory sound classification for an imbalanced data set using hybrid LSTM-KAN architectures},
  author = {Nithinkumar K. and Anand R},
  journal= {arXiv preprint arXiv:2601.03610},
  year   = {2026}
}