基于 Whisper 的微观可理解性预测的迁移学习
音频与语音处理
2024-09-12 v1 计算与语言
声音
摘要
宏观可理解性模型预测给定语音-噪声刺激的预期人类词错误率。在 contrastively,微观可理解性模型旨在对听者的感知做出细粒度的预测,例如预测音素或词汇响应。最先进的宏观模型使用从大规模语音处理深度学习模型迁移学习,而此类方法在微观建模中鲜见被使用。在本文中,我们研究使用从Whisper(一种面向自动语音识别的深度学习模型)迁移学习,用于微观可理解性预测,即在词汇响应层面进行预测。我们的方法在所考虑的基准测试中表现优异,即使在零样本设置下也能实现,fine-tuning后对预测听者响应可实现最高66%的相对改进。我们的结果展示了大规模深度学习方法在微观可理解性预测中的潜力。
引用
@article{arxiv.2404.01737,
title = {Transfer Learning from Whisper for Microscopic Intelligibility Prediction},
author = {Paul Best and Santiago Cuervo and Ricard Marxer},
journal= {arXiv preprint arXiv:2404.01737},
year = {2024}
}