利用预训练语言模型与大语言模型评估 ESL 语音的短语断句
计算与语言
2023-06-09 v1 声音
音频与语音处理
摘要
本工作介绍了利用预训练语言模型(PLMs)和大语言模型(LLMs)评估 ESL 学习者语音中短语断句的方法。共有两项任务:对一段语音片段的短语断句整体评估,以及对每个可能短语断句位置的细粒度评估。为利用 NLP 模型,首先将语音输入与文本进行强制对齐,然后预处理为包含词与短语断句信息的令牌序列。为使用 PLMs,我们提出一种基于处理后令牌的预训练与微调流程。该过程包括使用替换断句令牌检测模块进行预训练,以及使用文本分类与序列标注进行微调。为使用 LLMs,我们为 ChatGPT 设计了提示。实验表明,借助 PLMs,对标注训练数据的依赖已大幅降低,且性能得到提升。同时,我们验证了知名 LLM——ChatGPT 在该领域具有进一步改进的潜力。
引用
@article{arxiv.2306.04980,
title = {Assessing Phrase Break of ESL Speech with Pre-trained Language Models and Large Language Models},
author = {Zhiyi Wang and Shaoguang Mao and Wenshan Wu and Yan Xia and Yan Deng and Jonathan Tien},
journal= {arXiv preprint arXiv:2306.04980},
year = {2023}
}
备注
Accepted by InterSpeech 2023. arXiv admin note: substantial text overlap with arXiv:2210.16029