面向领域无关的因果感知婴儿哭声变换器
声音
2025-12-19 v1 人工智能
摘要
准确且可解释的婴儿哭声语汇特征分类是早期新生儿痛苦检测及临床决策支持的关键。然而,许多现有深度学习方法依赖于基于相关性的声学表征,因而对噪声、伪线索以及不同录音环境中的领域迁移问题十分敏感。我们提出DACH-TIC(Domain-Agnostic Causal-Aware Hierarchical Audio Transformer),用于实现稳健的婴儿哭声分类。该模型集成了因果注意力、层次表征学习、多任务监督以及对抗式域泛化,构建于统一框架内。DACH-TIC采用结构化Transformer骨干网络,包含局部token级和全局语义编码器,辅以因果注意力掩码和受控扰动训练,以近似模拟反事实声学变化。域对抗目标促进环境不变的表征,而多任务学习同时优化哭声类型识别、痛苦强度估计及因果相关性预测。模型在Baby Chillanto和Donate-a-Cry数据集上进行评估,并采用ESC-50环境噪声叠加进行域增强。实验结果表明,DACH-TIC在准确率上提升2.6个百分点,在宏平均F1分数上提升2.2分,同时实现了更好的因果保真度。该模型对未见声学环境具有良好的泛化能力,域性能差距仅为2.4个百分点,证明其适用于实际中的新生儿声学监测系统。
引用
@article{arxiv.2512.16271,
title = {Domain-Agnostic Causal-Aware Audio Transformer for Infant Cry Classification},
author = {Geofrey Owino and Bernard Shibwabo Kasamani and Ahmed M. Abdelmoniem and Edem Wornyo},
journal= {arXiv preprint arXiv:2512.16271},
year = {2025}
}
备注
This paper has been published in the IEEE proceedings of the 8th International Conference of Computer and Informatics Engineering (IC2IE)