中文

OLSA矩阵句子测试视频材料的制作与评估

音频与语音处理 2021-04-01 v3 图像与视频处理

摘要

矩阵句子测试(MST)是公认的多语言语音清晰度测试方法之一。该测试的大多数版本采用纯音频刺激设计。然而,视觉线索在语音清晰度中起着重要作用,多数情况下通过读唇使语音更易理解。本工作中,我们展示了Oldenburger女性MST(OLSA)配音视频的制作与评估。28名听力正常受试者完成了测试与重测环节,条件涵盖音频与视觉模态、安静与噪声下的语音,以及开放与封闭集应答格式。针对不同条件自适应测量了达到80%句子清晰度的声级。在安静环境下,相比纯音频,视听增益为7 dB声压级(SPL)。在噪声下,视听增益为5 dB信噪比(SNR)。仅视觉句子的读唇得分在0%至84%语音接收之间,受试者平均值为50%。读唇能力的巨大差异反映于视听语音接收阈(SRT)中,其标准差大于纯音频SRT。发现了视听句子中的训练与学习效应:受试者在5次试验后SRT改善了约3 dB SNR。受试者在独立的重测环节中保持了最佳得分,并进一步将SRT改善了约-1.5 dB。

关键词

引用

@article{arxiv.1912.04700,
  title  = {Development and Evaluation of Video Recordings for the OLSA Matrix Sentence Test},
  author = {Gerard Llorach and Frederike Kirschner and Giso Grimm and Melanie A. Zokoll and Kirsten C. Wagener and Volker Hohmann},
  journal= {arXiv preprint arXiv:1912.04700},
  year   = {2021}
}

备注

10 pages, 9 figures