基于层次的自监督表示分析:儿童语音中的年龄和性别分类
音频与语音处理
2025-08-15 v1 人工智能
人机交互
机器学习
声音
摘要
儿童语音因音高、发音和发育特征的高变异性,给年龄和性别分类带来了挑战。虽然自监督学习(SSL)模型在成人语音任务中表现良好,但其在儿童语音中编码说话特征的能力仍有待探索。本文针对四个 Wav2Vec2 变体,对其在 PFSTAR 和 CMU Kids 数据集上的表现进行了详细的层次分析。结果表明,早期层(1-7)比深层更有效地捕获说话人特征,而深层则越来越关注语言信息。应用 PCA 可进一步提升分类效果,减少冗余并凸显最具信息性的成分。Wav2Vec2-large-lv60 模型在 CMU Kids 数据集上实现了 97.14%(年龄)和 98.20%(性别)的准确率;base-100h 和 large-lv60 模型在 PFSTAR 数据集上分别达到 86.05% 和 95.00%。这些结果揭示了说话特征在 SSL 模型深度中的结构,支持面向儿童的语音界面更精准的、自适应的策略。
引用
@article{arxiv.2508.10332,
title = {Layer-Wise Analysis of Self-Supervised Representations for Age and Gender Classification in Children's Speech},
author = {Abhijit Sinha and Harishankar Kumar and Mohit Joshi and Hemant Kumar Kathania and Shrikanth Narayanan and Sudarsana Reddy Kadiri},
journal= {arXiv preprint arXiv:2508.10332},
year = {2025}
}
备注
Accepted at Workshop on Child Computer Interaction (WOCCI 2025)