GeHirNet:面向声学病变分类的性别感知层次模型
声音
2025-08-05 v1 人工智能
音频与语音处理
摘要
AI 语音分析在疾病诊断方面显示出广泛前景,但现有分类器因性别相关的声学差异及罕见疾病数据的稀缺,往往难以准确识别特定病变。我们提出一种新颖的两阶段框架:第一阶段使用 ResNet-50 对 Mel 频谱图进行处理,识别性别特定的病变模式;第二阶段进行性别条件疾病分类。我们通过多尺度重抽样和时间错位增强来解决类别不平衡问题。在来自四个公共数据存储库的合并数据集上评估,我们的两阶段架构结合时间错位增强实现了最先进的性能(97.63% 准确率,95.25% MCC),相较于单阶段基线提升了 5% 的 MCC。该工作通过对声学特征进行层次建模,推动了声学病变分类的发展,同时减少了性别偏差。
引用
@article{arxiv.2508.01172,
title = {GeHirNet: A Gender-Aware Hierarchical Model for Voice Pathology Classification},
author = {Fan Wu and Kaicheng Zhao and Elgar Fleisch and Filipe Barata},
journal= {arXiv preprint arXiv:2508.01172},
year = {2025}
}