中文

基于层次的自监督表示分析:儿童语音中的年龄和性别分类

音频与语音处理 2025-08-15 v1 人工智能 人机交互 机器学习 声音

摘要

儿童语音因音高、发音和发育特征的高变异性,给年龄和性别分类带来了挑战。虽然自监督学习(SSL)模型在成人语音任务中表现良好,但其在儿童语音中编码说话特征的能力仍有待探索。本文针对四个 Wav2Vec2 变体,对其在 PFSTAR 和 CMU Kids 数据集上的表现进行了详细的层次分析。结果表明,早期层(1-7)比深层更有效地捕获说话人特征,而深层则越来越关注语言信息。应用 PCA 可进一步提升分类效果,减少冗余并凸显最具信息性的成分。Wav2Vec2-large-lv60 模型在 CMU Kids 数据集上实现了 97.14%(年龄)和 98.20%(性别)的准确率;base-100h 和 large-lv60 模型在 PFSTAR 数据集上分别达到 86.05% 和 95.00%。这些结果揭示了说话特征在 SSL 模型深度中的结构,支持面向儿童的语音界面更精准的、自适应的策略。

关键词

引用

@article{arxiv.2508.10332,
  title  = {Layer-Wise Analysis of Self-Supervised Representations for Age and Gender Classification in Children's Speech},
  author = {Abhijit Sinha and Harishankar Kumar and Mohit Joshi and Hemant Kumar Kathania and Shrikanth Narayanan and Sudarsana Reddy Kadiri},
  journal= {arXiv preprint arXiv:2508.10332},
  year   = {2025}
}

备注

Accepted at Workshop on Child Computer Interaction (WOCCI 2025)