基于解耦表示的医疗语音症状分类
人工智能
2024-05-01 v3
摘要
在现有工作中,意图被定义为理解口语的关键。医疗语音中的文本特征和声学特征均包含对症状诊断至关重要的意图信息。本文提出了一种名为 DRSC 的医疗语音分类模型,该模型能够自动学习从文本 - 声学数据中解耦意图和内容表示以进行分类。通过意图编码器提取文本域和 Mel 频谱图域的意图表示,随后经过两次交换获得重构的文本特征和 Mel 频谱图特征。将来自两个域的意图结合成联合表示后,整合后的意图表示被送入决策层进行分类。实验结果表明,我们的模型在检测 25 种不同医疗症状时的平均准确率达到 95%。
引用
@article{arxiv.2403.05000,
title = {Medical Speech Symptoms Classification via Disentangled Representation},
author = {Jianzong Wang and Pengcheng Li and Xulong Zhang and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2403.05000},
year = {2024}
}
备注
Accepted by the 27th International Conference on Computer Supported Cooperative Work in Design (CSCWD 2024)