中文

基于自监督语音表征的听力受损者非侵入式可懂度预测器

声音 2023-12-08 v3 机器学习 音频与语音处理

摘要

自监督语音表征(SSSRs)已成功应用于若干语音处理任务,例如作为语音质量(SQ)预测的特征提取器,而语音质量预测又与为听力正常或受损用户评估和训练语音增强系统相关。然而,此类表征为何以及如何良好地编码质量相关信息仍知之甚少。本文将对 SQ 评分的非侵入式预测技术扩展至听力受损用户可懂度的预测。研究发现,自监督表征作为非侵入式预测模型的输入特征十分有用,取得了与更复杂系统相媲美的性能。基于 Clarity Prediction Challenge 1 听者和增强系统的详细性能分析表明,可能需要更多数据才能实现对未知系统以及(听力受损)个体的泛化。

关键词

引用

@article{arxiv.2307.13423,
  title  = {Non Intrusive Intelligibility Predictor for Hearing Impaired Individuals using Self Supervised Speech Representations},
  author = {George Close and Thomas Hain and Stefan Goetze},
  journal= {arXiv preprint arXiv:2307.13423},
  year   = {2023}
}

备注

Accepted @ ASRU 2023 SPARKS workshop