中文

面向痴呆检测的时间感知迭代语音模型

声音 2025-10-02 v1 人工智能 音频与语音处理

摘要

深度学习系统在处理长序列时常常难以为力,计算复杂度往往成为瓶颈。当前用于自动化痴呆检测的语音方法常依赖静态、时序无关的特征或聚合后的语言内容,缺乏灵活性来建模语音生产中固有的细微、逐渐恶化的模式。这些方法往往错失那些对认知功能衰退至关重要的动态时序模式。本文引入 TAI-Speech,一个时序感知迭代框架,动态建模自发语音以实现痴呆检测。本方法的灵活性通过两种关键创新得以体现:1) 受光流启发的迭代细化:将语谱图视为顺序帧,此组件使用卷积 GRU 捕捉语音特征在帧与帧之间细微的演变。2) 基于交叉注意力的韵律对齐:此组件动态地将谱系特征与韵律模式(如音高和停顿)对齐,以构建更丰富的语音生产缺陷表征,关联至功能衰退 (IADL)。TAI-Speech 对每个语音单元的时序演变进行自适应建模,增强了对认知标记的检测。在 DementiaBank 数据集上的实验结果表明,TAI-Speech 实现了 0.839 的强大 AUC 和 80.6% 的准确率,超越了不依赖语音识别的文本基线方法。我们的工作为自动化认知评估提供了更灵活且稳健的解决方案,直接作用于原始音频的动态特性。

关键词

引用

@article{arxiv.2510.00030,
  title  = {Temporal-Aware Iterative Speech Model for Dementia Detection},
  author = {Chukwuemeka Ugwu and Oluwafemi Oyeleke},
  journal= {arXiv preprint arXiv:2510.00030},
  year   = {2025}
}