用于解释多变量生理时间序列的多智能体框架
机器学习
2026-03-05 v1
摘要
持续的生理监测是急诊护理的核心,但部署可信赖的AI系统仍具有挑战。虽然大语言模型(LLM)可以将复杂的生理信号转化为临床叙述,但智能体系统的表现是否优于零-shot推理尚不明确。为此,我们提出了Vivaldi,一个具有角色结构的多智能体系统,用于解释多变量生理时间序列。由于监管限制,使其无法在现场部署,我们在一小群高度合格的急诊医学专家的受试者中进行了受控的临床试验,其评估结果呈现出与先行假设相反的情景,即智能体推理在不同情况下并不总是提高性能。我们的实验表明,智能体管道显著增强了非思考型和医学精调模型的表现,分别使专家评估的解释合理性提升6.9分,相关性提升9.7分。相反,对于思考型模型,智能体编排往往会降低解释质量,包括相关性下降14分,但在诊断精确度方面有所提高(ESI F1提升3.6分)。我们还发现,显式基于工具的计算对于可计算的临床指标至关重要,而主观目标,如疼痛评分和住院时间,则显示出有限或不一致的变化。专家评估进一步表明,临床实用性的提升取决于可视化约定,医学专业化模型在实用性和清晰性之间实现了最有利的权衡。总之,这些发现表明,智能体AI的价值在于选择性地外部化计算和结构,而不是在最大化推理复杂性方面,而这些发现对广泛适用于安全关键医疗保健环境中的可解释AI具有广泛的指导意义。
引用
@article{arxiv.2603.04142,
title = {A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series},
author = {Davide Gabrielli and Paola Velardi and Stefano Faralli and Bardh Prenkaj},
journal= {arXiv preprint arXiv:2603.04142},
year = {2026}
}