内部表征而非临床知识:显现 LLM triage 失效的根源
计算与语言
2026-05-29 v1 人工智能
摘要
患者叙述的临床 triage 基准报告显示,消费者大语言模型在受限多选输出格式下存在较高的漏诊率,但相同案例在自然语言格式下得分不同。我们询问输出格式是否改变模型的临床表征,或仅改变从保存表征到答案的映射。利用 Gemma 3 4B/12B IT 和 Qwen3-8B 中的稀疏自动编码器(SAE)特征,我们发现两种格式下相同医学特征在共享临床叙述中均会激活,但在多选决策词元处所有模型的所有案例中均变为静默状态。三个独立方法(自然语言自动编码器 verbalization、决策词元 logit 归因和主导特征特征征)一致表明,脚手架和格式特征而非医学特征驱动决策 logit。行为上,多选惩罚在两种结构化和自然语言输入下均会反转,选项顺序随机化排除了位置偏见,差距主要由 off-by-one 决策(模型挑选相邻 acuity 字母作为金标准答案)而非知识缺失所致。因此,该失效源于输出格式而非临床表征。
引用
@article{arxiv.2605.29889,
title = {Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate},
author = {David Fraile Navarro and Berardino Como and Jialei Sheng and Soundariya Ananthan and Shlomo Berkovsky},
journal= {arXiv preprint arXiv:2605.29889},
year = {2026}
}
备注
9 pages main text, 27 pages total including appendices; 7 figures, 25 tables