Whisper微调用于包容性韵律重音分析
声音
2025-03-06 v1 机器学习
音频与语音处理
摘要
韵律在语音感知中起着至关重要的作用,影响人类理解和自动语音识别(ASR)系统。尽管其重要性,韵律重音因高效分析其的挑战而仍未被充分研究。本研究探索了微调OpenAI的Whisper large-v2 ASR模型以识别语音中的短语重音、词汇重音和对比重音。使用一个包含66名母语为英语的说话者的数据集,包括男性、女性、神经典型和神经多样性个体,我们评估了模型泛化重音模式的能力,以及根据简短语音样本按神经类型和性别对说话者进行分类的能力。我们的结果展示了在所有三种重音类型上ASR性能接近人类水平,以及在性别和神经类型分类上接近完美的精确度。通过改进韵律感知的ASR,这项工作为多样化人群贡献了公平且鲁棒的转录技术。
引用
@article{arxiv.2503.02907,
title = {Fine-Tuning Whisper for Inclusive Prosodic Stress Analysis},
author = {Samuel S. Sohn and Sten Knutsen and Karin Stromswold},
journal= {arXiv preprint arXiv:2503.02907},
year = {2025}
}
备注
Appears in Proceedings of the ISCA/ITG Workshop on Diversity in Large Speech and Language Models