中文

利用WavLM嵌入从语音中预测人口属性

计算与语言 2025-02-18 v1 人工智能

摘要

本文提出了一种基于WavLM特征的通用分类器,用于从语音中推断人口特征,如年龄、性别、母语、教育程度和国籍。人口特征预测在语言学习、无障碍技术和数字取证等应用中发挥着关键作用,使技术更加个性化和包容。利用预训练模型进行嵌入提取,所提出的框架识别了与人口属性相关的关键声学和语言特征,在年龄预测中实现了平均绝对误差(MAE)为4.94,在性别分类中实现了超过99.81%的准确率,且跨多个数据集均表现良好。我们的系统在MAE上相对于现有模型提升了最高30%(相对),在准确率和F1分数上提升了最高10%(相对),这得益于多样化的数据集和大型预训练模型的使用,确保了鲁棒性和泛化能力。本研究为说话者多样性提供了新的见解,并为基于语音的人口特征分析的未来研究奠定了坚实基础。

关键词

引用

@article{arxiv.2502.12007,
  title  = {Demographic Attributes Prediction from Speech Using WavLM Embeddings},
  author = {Yuchen Yang and Thomas Thebaud and Najim Dehak},
  journal= {arXiv preprint arXiv:2502.12007},
  year   = {2025}
}

备注

6 pages, accepted by The Conference on Information Sciences and Systems (CISS)