RAMoEA-QA:面向鲁棒呼吸音频问答的层次化特化
声音
2026-05-06 v2 人工智能
摘要
对话式生成式AI在医疗保健领域的探索日益增多,其中模型必须整合异质患者信号并支持多样化的交互风格,同时产生具有临床意义的输出。在呼吸护理中,使用传感设备捕获的无创音频记录为筛查和纵向监测提供了一条可扩展的途径,但异质性尤为突出:记录因设备、环境和采集协议而异,查询的意图、答案格式和预测目标也可能不同。现有的用于呼吸评估的生物医学音频-语言问答系统开始出现,但它们通常被构建为单路径模型,尽管记录条件和查询类型存在差异,仍通过相同的声学和语言路径处理所有输入。它们也通常在相对有限的环境下进行评估,其在现实分布偏移(包括采集域、模态和临床任务的变化)下的鲁棒性尚不明确。为填补这一空白,我们引入了RAMoEA-QA,这是首个旨在统一的两阶段层次化框架内,支持跨异质记录和查询类型进行输入依赖特化的RA QA模型。我们在一个统一的RA QA设置中研究这种设计,该设置涵盖临床和自记录、多设备采集环境、问题格式以及离散和连续目标。在域内和受控偏移评估中,RAMoEA-QA在判别任务上优于匹配的单体基线和路由控制,域内测试准确率达到0.72(而单路径基线分别为0.61和0.67),同时在回归任务上也取得了最佳性能,并在数据集、模态和任务偏移下实现了更强的平均迁移,包括在COPD模态偏移设置中准确率提升高达23个百分点。
引用
@article{arxiv.2603.06542,
title = {RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering},
author = {Gaia A. Bertolino and Yuwei Zhang and Tong Xia and Domenico Talia and Cecilia Mascolo},
journal= {arXiv preprint arXiv:2603.06542},
year = {2026}
}