认知盲化:用于审计 LLM 辅助分析中先验污染的推理时协议
人工智能
2026-04-08 v1 计算与语言
摘要
本文在代理系统中提出了认知盲化,该系统使用大语言模型跨多个生物数据集进行推理以进行药物靶点优先级排序。在开发过程中,人们意识到 LLM 输出在数据驱动的推理与关于命名实体的记忆化先验之间无声地融合——而这种融合是不可见的:无法从单个输出中确定有多少来自页面上的数据,有多少来自模型的训练记忆。认知盲化是一种简单的推理时协议,在提示之前用匿名代码替换实体标识符,然后将输出与未盲化对照进行比较。该协议不会使 LLM 推理确定化,但它恢复了一个关键的可审计轴:测量输出中有多少来自所提供的数据 versus 模型的参数化知识。完整的靶点识别系统被描述——包括 LLM 引导的评分函数进化优化和用于靶点合理化的盲化代理推理——并演示了两个阶段均无需访问实体身份即可运行。在四种癌症类型的肿瘤药物靶点优先级排序中,盲化改变了 16% 的前 20 名预测,同时保持了对已验证靶点的相同恢复。污染问题被证明可以推广到生物学之外:在 S&P 500 股票筛选中,品牌识别偏见重塑了五个随机种子中 30-40% 的前 20 名排名。为了降低采用门槛,该协议作为开源工具发布,并作为 Claude Code 技能发布,可在代理工作流中实现一键认知盲化。该主张不是盲化分析产生了更好的结果,而是如果没有盲化,就无法知道代理在多大程度上遵循了研究者设计的分析过程。
引用
@article{arxiv.2604.06013,
title = {Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis},
author = {Michael Cuccarese},
journal= {arXiv preprint arXiv:2604.06013},
year = {2026}
}
备注
code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures