MedMosaic:医学音频的大规模多样化基准数据集
声音
2026-05-29 v2 人工智能
计算与语言
摘要
医学音频数据因隐私法规和源自专业知识的高标注成本而难以收集,因此现有基准数据集往往不足以代表复杂的医学音频场景。为此,我们提出MedMosaic,一个设计用于基准测试语言和音频推理模型的医学音频问答数据集,旨在满足现实临床约束。MedMosaic 包含多样化的医学音频类型,包括与疾病相关的生理声音、精心构建的合成语音以模拟带有人工噪声的语音,以及真实的短期和长期临床对话,以建模不同的上下文长度。该数据集还包含 46,701 对问答对,涵盖多个-choice、顺序多回合和开放式问答类别,能够系统评估多跳推理和答案生成能力。对 13 种音频和多模态推理模型进行基准测试显示,尽管所有评估系统都面临挑战,但各模型在不同问答类型下的性能存在显著差异。特别是,即便是像 Gemini-2.5-pro 这类最先进的模型也只能实现约 68.1% 的准确率。这些发现凸显了医学推理中的持久局限性,凸显了需要更稳健、针对特定领域的多模态推理模型的需求。基准数据的一部分可在此处获取:https://shorturl.at/Lyp33
引用
@article{arxiv.2605.00969,
title = {MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio},
author = {Harshit Rajgarhia and Shuubham Ojha and Asif Shaik and Akhil Pothanapalli and Rachuri Lokesh and Abhishek Mukherji and Prasanna Desikan},
journal= {arXiv preprint arXiv:2605.00969},
year = {2026}
}
备注
Accepted at ICML 2026