中文

理解基于扩散的图像生成中的痴呆语音对齐

机器学习 2025-08-14 v1 人工智能

摘要

文本到图像模型根据自然语言描述生成高度逼真的图像,数百万用户使用它们在线创建和分享图像。虽然期望此类模型能够将输入文本和生成的图像在同一潜空间中对齐,但对于这种对齐是否可能存在于病理语音和生成图像之间,目前的研究还很少。在本研究中,我们考察了此类模型将痴呆相关语音信息与生成图像对齐的能力,并开发了方法来解释这种对齐。令人惊讶的是,我们发现仅从生成的图像中就可以进行痴呆检测,在 ADReSS 数据集上达到了 75% 的准确率。随后,我们利用可解释性方法展示了语言的哪些部分对检测有所贡献。

关键词

引用

@article{arxiv.2508.09385,
  title  = {Understanding Dementia Speech Alignment with Diffusion-Based Image Generation},
  author = {Mansi and Anastasios Lepipas and Dominika Woszczyk and Yiying Guan and Soteris Demetriou},
  journal= {arXiv preprint arXiv:2508.09385},
  year   = {2025}
}

备注

Paper accepted at Interspeech 2025