中文

用于嗓音共识听觉感知评估质量评价的轻量级自动音频参数提取

声音 2023-11-28 v1 机器学习 音频与语音处理

摘要

嗓音共识听觉感知评估(Consensus Auditory-Perceptual Evaluation of Voice)是临床嗓音质量评估中广泛使用的工具,对于临床专业人员间的流式交流以及确定进一步治疗的基准具有重要意义。目前,由于该评估依赖经验丰富的临床医生,往往存在不一致性,因而难以标准化。为解决此问题,我们提出利用轻量级自动音频参数提取,以提升临床相关性、降低复杂度并增强嗓音质量评估的可解释性。所提方法利用年龄、性别以及五个音频参数:jitter、absolute jitter、shimmer、谐噪比(HNR)和过零率。采用了经典的机器学习方法。结果表明,我们的方法性能与当前最优(SOTA)方法相近,且优于使用流行音频预训练模型获得的潜在表示。该方法为不同特征提取方法用于嗓音评估的可行性提供了见解。诸如 jitter 和 HNR 等音频参数被证明适用于刻画粗糙度与紧张度等嗓音质量属性。相反,预训练模型在有效处理与噪声相关的评分方面存在局限。本研究通过全面探索多样评估方法,推动了更详尽精确的嗓音质量评价。

关键词

引用

@article{arxiv.2311.15582,
  title  = {Lightly Weighted Automatic Audio Parameter Extraction for the Quality Assessment of Consensus Auditory-Perceptual Evaluation of Voice},
  author = {Yi-Heng Lin and Wen-Hsuan Tseng and Li-Chin Chen and Ching-Ting Tan and Yu Tsao},
  journal= {arXiv preprint arXiv:2311.15582},
  year   = {2023}
}

备注

Published in IEEE 42th International Conference on Consumer Electronics (ICCE 2024)