中文

从婴儿啼哭中提取信息的语音 transformer 模型

声音 2025-09-03 v1 机器学习 应用统计

摘要

在标记数据稀缺的任务中,使用来自预训练语音模型的潜在表示实现了卓越的性能。然而,这些模型应用于非语音数据以及这些表示中编码的特定声学特性的适用性仍然鲁有探索。本研究检验了上述两个方面。我们对 5 个预训练语音模型在 8 个婴儿啼哭数据集上进行评估,涵盖 960 名婴儿的 115 小时的音频。对于每个数据集,我们评估了每个模型在所有可用分类任务上的潜在表示。在实验结果表明,这些模型的潜在表示能够有效分类人类婴儿啼哭,并编码与嗓音源不稳定性和啼哭婴儿身份相关的关键信息。此外,对这些模型的体系结构和训练策略进行比较,为设计面向类似任务(如情感检测)的未来模型提供了有价值的见识。

关键词

引用

@article{arxiv.2509.02259,
  title  = {Speech transformer models for extracting information from baby cries},
  author = {Guillem Bonafos and Jéremy Rouch and Lény Lego and David Reby and Hugues Patural and Nicolas Mathevon and Rémy Emonet},
  journal= {arXiv preprint arXiv:2509.02259},
  year   = {2025}
}

备注

Accepted to WOCCI2025 (interspeech2025 workshop)