MADE: 基于医疗器器器材不良事件不确定性量化的多标签文本分类活 benchmark
计算与语言
2026-04-17 v1
摘要
机器学习在高风险领域如医疗保健领域中,不仅需要强大的预测性能,还需要可靠的不确定性量化 (UQ) 以支持人类监督。多标签文本分类 (MLTC) 是该领域的核心任务,但面临标签不平衡、依赖性和组合复杂性等挑战。现有的 MLTC 基准测试日益饱和,可能受训练数据污染影响,难以区分真实推理能力与记忆。我们引入 MADE,一个源自医疗器器器材不良事件报告的活跃 MLTC 基准,持续更新以获取新发布的报告以防止数据污染。MADE 特点是标签呈长尾分布且具有分层结构,支持严格的时间分割以实现可重复评估。我们在超过 20 个编码器和解码器模型上建立基线,包括在微调和少数学习设置下的指令调校/推理变体、本地/API 可访问模型。我们系统性地评估了基于熵/一致性和自 verbalized UQ 方法。结果显示清晰的权衡:较小的判别式微调解码器在保持有竞争力的 UQ 的同时实现最强的 head-to-tail 准确率;生成式微调提供最可靠的 UQ;大型推理模型在罕见标签上提升性能,却出人意料地表现弱 UQ;自 verbalized 置信度并非不确定性的可靠代理。我们的工作已公开于 https://hhi.fraunhofer.de/aml-demonstrator/made-benchmark。
引用
@article{arxiv.2604.15203,
title = {MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events},
author = {Raunak Agarwal and Markus Wenzel and Simon Baur and Jonas Zimmer and George Harvey and Jackie Ma},
journal= {arXiv preprint arXiv:2604.15203},
year = {2026}
}
备注
Accepted at ACL 2026 Mains