SpeechCT-CLIP:将文本-图像知识蒸馏至语音以实现原生语音的多模态 CT 分析
音频与语音处理
2025-10-06 v1 计算与语言
摘要
语音交流在临床工作流程中扮演着核心角色。例如在放射学中,大多数报告是通过口述创建的。然而,几乎所有医疗 AI 系统都完全依赖于书面文本。在这项工作中,我们通过探索直接从口述放射学报告中学习视觉-语言表示的可行性来填补这一空白。具体而言,我们合成了一个大规模的口述放射学报告数据集(Speech-RATE),并训练了 SpeechCT-CLIP,这是一种在共享表示空间中对齐语音和 3D CT 体积的对比模型。虽然朴素的基于语音的模型表现不如基于文本训练的对应模型,但我们表明,从预训练的文本-图像 CLIP 模型进行知识蒸馏,能有效地将语义对齐能力从文本转移到语音,从而大幅缩小这一差距。实验表明,零样本分类 F1 分数从 0.623 提升至 0.705,恢复了 88% 的性能差异,并且在推理时无需文本即可获得强大的检索结果。这些发现突显了语音作为多模态预训练中文本的实用替代方案,并为临床实践中的语音驱动诊断支持工具打开了大门。
引用
@article{arxiv.2510.02322,
title = {SpeechCT-CLIP: Distilling Text-Image Knowledge to Speech for Voice-Native Multimodal CT Analysis},
author = {Lukas Buess and Jan Geier and David Bani-Harouni and Chantal Pellegrini and Matthias Keicher and Paula Andrea Perez-Toro and Nassir Navab and Andreas Maier and Tomas Arias-Vergara},
journal= {arXiv preprint arXiv:2510.02322},
year = {2025}
}
备注
Submitted to ICASSP 2026; under review