中文

用于临床神经科学大语言模型稳定可解释性的单义归因框架

计算与语言 2026-01-27 v1 人工智能

摘要

可解释性仍然是在临床环境(如阿尔茨海默病进展诊断)中部署大语言模型(LLMs)的关键挑战,在这些环境中,早期且可信的预测至关重要。由于 LLM 表示的多义性,现有的归因方法表现出高跨方法变异性和不稳定的解释,而机制可解释性方法缺乏与模型输入和输出的直接对齐,且不提供明确的重要性分数。我们引入了一个统一的可解释性框架,通过单义特征提取整合归因和机制视角。通过在 LLM 层级构建单义嵌入空间,并优化该框架以显式减少跨方法变异性,我们的方法生成了稳定的输入级重要性分数,并通过感兴趣层的解压表示突出了显著特征,推进了 LLM 在认知健康和神经退行性疾病中的安全与可信应用。

关键词

引用

@article{arxiv.2601.17952,
  title  = {A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Large Language Models},
  author = {Michail Mamalakis and Tiago Azevedo and Cristian Cosentino and Chiara D'Ercoli and Subati Abulikemu and Zhongtian Sun and Richard Bethlehem and Pietro Lio},
  journal= {arXiv preprint arXiv:2601.17952},
  year   = {2026}
}