自动化临床症状检测工作流程中的优化不稳定性
人工智能
2026-02-19 v1 多智能体系统
摘要
那些持续自我完善自身行为的自主代理工作流程在各方面都有巨大的潜力,但其失效模式仍然鲜为人知。我们调查了优化不稳定性——一种现象,即持续的自主改进反而会导致分类器性能恶化的现象,使用 Pythia——一个用于自动提示优化的开源框架。我们评估了三种不同患病率的临床症状(呼吸急促为 23%,胸痛为 12%,长新冠脑雾为 3%),发现验证灵敏度在迭代之间在 1.0 与 0.0 之间振荡,严重程度与患病率呈反比。当患病率为 3% 时,系统达到了 95% 的准确率,但未检测到任何阳性病例,这种失效模式被常规评估指标掩盖。我们评估了两种干预措施:一个引导型代理主动重导向优化,放大了过拟合而非纠正它;一个选择型代理则在事后识别最佳迭代,成功防止了灾难性失效。有了选择型代理监督,该系统在脑雾检测中凭借单个自然语言术语输入,就比专家精选的词典表达量提升了 331%(F1 分数),胸痛检测提升了 7%。这些发现刻画了自主 AI 系统的关键失效模式,证明了在低患病率分类任务中,事后选择优于主动干预以实现稳定。
引用
@article{arxiv.2602.16037,
title = {Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection},
author = {Cameron Cagan and Pedram Fard and Jiazi Tian and Jingya Cheng and Shawn N. Murphy and Hossein Estiri},
journal= {arXiv preprint arXiv:2602.16037},
year = {2026}
}