MedSkillAudit:一个面向医学研究智能体技能的领域特定审计框架
人工智能
2026-04-23 v1
摘要
背景:智能体技能越来越多地作为模块化、可复用的能力单元部署在AI智能体系统中。医学研究智能体技能需要超越通用评估的保障措施,包括科学诚信、方法学有效性、可重复性和边界安全性。本研究开发并初步评估了一个面向医学研究智能体技能的领域特定审计框架,重点关注其相对于专家评审的可靠性。方法:我们开发了MedSkillAudit([email protected]),这是一个在部署前评估技能发布就绪状态的分层框架。我们评估了跨越五个医学研究类别的75项技能(每类15项)。两位专家独立分配了质量评分(0-100)、有序的发布处置(生产就绪/有限发布/仅限Beta/拒绝)以及高风险失败标志。系统与专家之间的一致性使用ICC(2,1)和线性加权Cohen's kappa进行量化,并以人类评分者间基线为基准。结果:平均共识质量评分为72.4(标准差=13.0);57.3%的技能低于“有限发布”阈值。MedSkillAudit的ICC(2,1)为0.449(95%置信区间:0.250-0.610),超过了人类评分者间ICC的0.300。系统-共识评分差异(标准差=9.5)小于专家间差异(标准差=12.4),且无方向性偏差(Wilcoxon p = 0.613)。“方案设计”类别显示出最强的类别级一致性(ICC = 0.551);“学术写作”类别显示出负的ICC(-0.567),反映了结构化的评分标准与专家判断之间的结构性不匹配。结论:领域特定的部署前审计可能为管理医学研究智能体技能提供一个实用的基础,通过为科学用例量身定制的结构化审计工作流来补充通用质量检查。
引用
@article{arxiv.2604.20441,
title = {MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills},
author = {Yingyong Hou and Xinyuan Lao and Huimei Wang and Qianyu Yao and Wei Chen and Bocheng Huang and Fei Sun and Yuxian Lv and Weiqi Lei and Xueqian Wen and Pengfei Xia and Zhujun Tan and Shengyang Xie},
journal= {arXiv preprint arXiv:2604.20441},
year = {2026}
}
备注
20 pages, 9 figures, 1 graphic abstract, 4 tables