基于多模态大型语言模型的个人化语音治疗辅助系统:UTI-LLM
声音
2025-11-03 v2
摘要
语音治疗是针对由中风等神经性损伤导致的语音障碍进行康复的 essential 方法。然而,传统的手动和计算机辅助系统在实时可访问性和语音运动反馈方面受到限制。近期发展表明,多模态大型语言模型(MLLM)在医疗领域具有显著潜力,尤其是在其自适应评估和治疗反馈能力方面。然而,挑战包括获取和融合足够的语音信息、对语音器官运动轨迹的解析不足,以及缺乏特定领域的数据集,阻碍了MLLM在语音治疗中的应用。为此,我们提出一种基于MLLM的语言康复辅助系统,利用乳腺 ultrasound imaging 和语音信号提供精确、交互式的语音运动反馈。我们构建了一个高质量的特定领域数据集,包含乳腺-语音对话对。这一数据集促进了微调,以增强模型的临床适应性。此外,我们的方法开发了乳腺视频和语音信号的时空融合训练策略,实现对语音障碍的精细分析,最终生成可操作的反馈。实验结果表明,我们的方法在语音分析和临床评估方面有效。
引用
@article{arxiv.2509.13145,
title = {UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language Model},
author = {Yudong Yang and Xiaokang Liu and Shaofeng zhao and Rongfeng Su and Nan Yan and Lan Wang},
journal= {arXiv preprint arXiv:2509.13145},
year = {2025}
}