绿色遮蔽:面向可信 AI 的用户中心方法
计算与语言
2026-04-28 v1 人工智能
摘要
大型语言模型(LLM)日益被部署,但其输出对用户如何表述查询这一常见、非对抗性变化极其敏感,这一问题尚未被现有红队测试充分解决。我们提出绿色遮蔽(Green Shielding),一种围绕构建基于证据的部署指导的、以用户为中心的议程,通过刻画良性输入变体如何影响模型行为来实现。我们通过 CUE 准则来操作化化这个议程:拥有真实情境的基准测试、捕捉真实效用的数据指标,以及反映模型行为获取中真实变体的扰动。围绕 PCS 框架、并由实践医生参与开发,我们在医学诊断领域实例化绿色遮蔽,构建了 HealthCareMagic-Diagnosis(HCM-Dx)基准,包含患者撰写的查询、结构化参考诊断集合以及临床导向的评估指标,用于评估差异诊断列表。我们还研究了捕捉常规输入变体的扰动情形,并展示提示级别因素在临床意义维度上如何影响模型行为。在多个前沿 LLM 上,这些行为变化勾勒出类似佩肖图的权衡。特别是,中性化处理会移除常见用户层面因素,同时保留临床内容,从而提高合理性并产生更简洁、类似临床医生的诊断,但会减少对高度可能且安全关键性条件的覆盖。总体而言,这些结果表明,交互选择会系统性地影响模型输出的任务相关属性,并为高风险领域的安全部署提供用户层面的指导。虽然在医学诊断中实现,但该议程可自然扩展至其他决策支持场景和具备智能体能力的 AI 系统。
引用
@article{arxiv.2604.24700,
title = {Green Shielding: A User-Centric Approach Towards Trustworthy AI},
author = {Aaron J. Li and Nicolas Sanchez and Hao Huang and Ruijiang Dong and Jaskaran Bains and Katrin Jaradeh and Zhen Xiang and Bo Li and Feng Liu and Aaron Kornblith and Bin Yu},
journal= {arXiv preprint arXiv:2604.24700},
year = {2026}
}