利用图像-文本对齐评估图画描述语音以检测痴呆
计算与语言
2023-08-17 v1 计算机视觉与模式识别
机器学习
摘要
利用图画描述语音进行痴呆检测已被研究30年。尽管历史长久,以往的模型侧重于识别健康受试者与痴呆患者之间语音模式的差异,却未直接利用图画信息。本文中,我们提出了首个同时将图画与描述文本作为输入并融入大型预训练图像-文本对齐模型知识的痴呆检测模型。我们观察到痴呆样本与健康样本在文本与图画的相关性以及图画关注区域上的差异。因此我们考量此类差异可用于提升痴呆检测准确率。具体而言,我们利用文本与图画的相关性对样本句子进行排序与筛选。我们还识别图画的关注区域作为主题,并根据关注区域对句子分类。我们提出了三种基于其与图画、子图像及关注区域相关性对样本进行预处理的进阶模型。评估结果显示,我们的进阶模型借助图画知识与大型图像-文本对齐模型,取得了最先进的性能,最佳检测准确率达83.44%,高于仅文本的基线模型79.91%。最后,我们对样本与图画结果进行可视化以解释模型优势。
引用
@article{arxiv.2308.07933,
title = {Evaluating Picture Description Speech for Dementia Detection using Image-text Alignment},
author = {Youxiang Zhu and Nana Lin and Xiaohui Liang and John A. Batsis and Robert M. Roth and Brian MacWhinney},
journal= {arXiv preprint arXiv:2308.07933},
year = {2023}
}