人工智能用于跨语言困语语音可理解性评估的应用
计算与语言
2025-05-09 v4 声音
音频与语音处理
摘要
目的: 语音可理解性是困语评估与管理的关键结果, 但大多数研究和临床实践仅聚焦英文, 限制了其跨语言适用性。本文引入一种概念框架, 并演示其实现方法, 以利用人工智能 (AI) 推动困语语音的跨语言可理解性评估。方法: 我们提出了两层次的概念框架, 包含一个通用语音模型用于将困语语音编码为声学-语音表示, 随后由面向特定语言的可理解性评估模型对这些表示进行解释, 融入该语言的音位或韵律结构。我们进一步识别了跨语言可理解性评估的障碍, 包括数据稀缺、标注复杂以及对困语语音有限的语言见解, 并概述了潜在的 AI 驱动解决方案以克服这些挑战。结论: 推进困语语音的跨语言可理解性评估需要高效且可扩展的模型, 但受制于语言规则以确保准确且语言敏感的评估。近期的 AI 进展为支持这一集成提供了基础工具, 指导未来通向通用且语言信息化评估框架的方向。
引用
@article{arxiv.2501.15858,
title = {Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech},
author = {Eunjung Yeo and Julie Liss and Visar Berisha and David Mortensen},
journal= {arXiv preprint arXiv:2501.15858},
year = {2025}
}
备注
14 pages, 2 figure, 2 tables