语言模型作为语义教师:医学音频理解的后训练对齐
声音
2026-04-20 v2 人工智能
摘要
预训练音频模型在检测听诊音频中的声学模式方面表现优异,但常常难以把握其临床意义,这限制了其在诊断任务中的应用和性能。为弥合这一差距,我们引入AcuLa(Audio-Clinical Understanding via Language Alignment),一种轻量级后训练框架,通过将其与医学语言模型对齐来为任何音频编码器灌输语义理解能力,其中语言模型充当“语义教师”。为实现大规模对齐,我们通过利用开箱即用的大语言模型将现有音频录音附带的丰富结构化元数据翻译为连贯的临床报告,从而构建大规模数据集。我们的对齐策略结合了表示层对比目标和自监督建模,确保模型在保持细粒度时序线索的同时学习临床语义。AcuLa在来自10个不同数据集的18个多样化心胸任务中实现了最先进的成绩,使分类基准的平均AUROC从0.68提升至0.79;在最具挑战性的COVID-19咳嗽检测任务中,AUROC从0.55提升至0.89。我们的工作表明,这种音频-语言对齐将纯粹声学模型转化为具临床意识的诊断工具,为增强生理学理解在基于音频的健康监测中建立了新范式。
引用
@article{arxiv.2512.04847,
title = {Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding},
author = {Tsai-Ning Wang and Lin-Lin Chen and Neil Zeghidour and Aaqib Saeed},
journal= {arXiv preprint arXiv:2512.04847},
year = {2026}
}