面向青年痰疯转录的合成生成方法
计算与语言
2025-10-31 v2 人工智能
机器学习
摘要
在青年痰疯研究中,言语-语言病理师(SLPs)会花费大量时间手动对语音样本进行编码,使用 Correct Information Units(CIUs)衡量单个语音样本的信息量。开发自动化系统识别青年痰疯语言受数据稀缺限制。例如,仅 AphasiaBank 中约有 600 份转录文本,而大语言模型(LLMs)使用的 token 数量可达数十亿。在更广泛的机器学习领域,研究者日益倾向于在数据稀缺时使用合成数据。因此,本研究构建并验证了两种生成 AphasiaBank Cat Rescue 图片描述任务转录的合成方法。一种方法利用程序化编程方法,另一种方法使用 Mistral 7b Instruct 和 Llama 3.1 8b Instruct LLMs。这些方法通过 word dropping、filler insertion 和 paraphasia substitution 在四个严重程度等级(轻度、中度、严重、极重度)生成转录文本。总体而言,我们发现与人类elicited转录文本相比,Mistral 7b Instruct 最能捕捉青年痰疯中观察到的语言退化的关键方面,在 NDW、词数和词长等方面展现出真实的方向性变化。基于结果,未来工作应计划创建更大数据集、微调模型以获得更好的青年痰疯表征,并让 SLPs 评估合成转录文本的真实性和实用性。
引用
@article{arxiv.2510.24817,
title = {Towards a Method for Synthetic Generation of Persons with Aphasia Transcripts},
author = {Jason M. Pittman and Anton Phillips and Yesenia Medina-Santos and Brielle C. Stark},
journal= {arXiv preprint arXiv:2510.24817},
year = {2025}
}
备注
19 pages, 1 figure, 7 tables