大型语言模型能否模仿人类语音用于临床评估?基于 LLM 的数据增强用于认知评分预测
计算与语言
2026-05-18 v1
摘要
由于数据集规模有限和类别不平衡,从自发性语音中准确评估认知衰退仍具挑战性。在这项工作中,我们提出了一种由大型语言模型(LLM)驱动的数据增强框架,以改善从语音预测认知评分的性能。实验在一个日语语料库上进行,其中每位参与者针对同一临床提示提供了自发性口头叙述和书面回答。书面回答作为语义锚点,用于通过 GPT-5 生成多种风格的口语化独白。然后,我们使用在 Sentence-BERT 语音嵌入上训练的偏最小二乘回归模型来预测长谷川痴呆量表评分,这是一种在日本广泛使用的认知筛查工具。我们研究了两种增强策略:随机类别平衡选择,它能带来中等但不稳定的改进;以及相似性引导的类别平衡选择。后者优先选择语义接近的合成样本,从而带来更一致的改进,并显著降低了少数低分参与者的预测误差,同时保持了多数群体的性能。总体而言,我们的发现证明了语义引导的 LLM 驱动增强作为一种原则性方法的潜力,可用于解决临床语音分析中的类别不平衡问题并提高数据效率。
引用
@article{arxiv.2605.16077,
title = {Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction},
author = {Si-Belkacem Yamine Ketir and Lenard Paulo Tamayo and Shohei Hisada and Shaowen Peng and Shoko Wakamiya and Eiji Aramaki},
journal= {arXiv preprint arXiv:2605.16077},
year = {2026}
}
备注
11 pages, 6 figures