强化功能失语者:利用高级大型语言模型进行精准语音纠正与多模态情感分析
计算与语言
2024-10-18 v1 人工智能
摘要
功能失语是由神经损伤导致的运动语音障碍,影响用于语音产生的肌肉,导致语音拗口、缓慢或难以理解。该病累及数百万人,包括中风、创伤性脑损伤、脑瘤、帕金森病和多发性硬化患者。功能失语构成沟通障碍,严重影响生活质量和社交交往。本文提出一种新方法,用于识别和翻译功能失语语音,赋能患者更有效地进行沟通。我们利用高级大型语言模型进行精准语音纠正和多模态情感分析。首先通过 OpenAI Whisper 模型将功能失语语音转换为文本,随后使用在 Groq AI 加速器上微调的开源模型以及 benchmark模型(如 GPT-4.o、LLaMA 3.1 70B 和 Mistral 8x7B)进行句子预测。所用数据集将 TORGO 数据集与 Google 语音数据合并,并手动标注情感语境。我们的框架识别情感包括快乐、悲伤、中性、惊讶、愤怒和恐惧,同时以高准确率重构受扭曲语音的原意。这一方法在功能失语语音的识别与解释方面实现了显著进展。
引用
@article{arxiv.2410.12867,
title = {Empowering Dysarthric Speech: Leveraging Advanced LLMs for Accurate Speech Correction and Multimodal Emotion Analysis},
author = {Kaushal Attaluri and Anirudh CHVS and Sireesha Chittepu},
journal= {arXiv preprint arXiv:2410.12867},
year = {2024}
}
备注
19 pages, 6 figures, 3 tables