解读针对放射科多模态大语言模型的洞见:稀疏自编码器方法
机器学习
2025-07-21 v2
摘要
可解释性可以提高 AI 模型的安全性、透明度和可信度,这在决策往往具有重大后果的医疗保健领域尤为重要。特别是通过稀疏自编码器(SAE)实现的机械可解释性,为在大型基于变换器的模型中揭示人类可解释特征提供了有前景的途径。本研究将 Matryoshka-SAE 应用于放射科专用多模态大语言模型 MAIRA-2,以解释其内部表示。通过对 SAE 特征的大规模自动可解释性,我们识别出一系列临床相关概念——包括医疗器械(例如导管和管路置入、起搏器存在)、如胸腔积液和心肥大等病理学表现、纵向变化以及文本特征。我们进一步通过驾驭这些特征对模型行为进行探讨,展示了在生成方面实现方向性控制,但实现效果有限。我们的结果揭示了实际和方法学上的挑战,却为 MAIRA-2 内部所学习概念提供了初始见解——标志着对放射科适应多模态大语言模型进行更深入的机械理解和可解释性的一步步进展,并为改进模型透明度铺平了道路。我们发布了训练好的 SAEs 和解释:https://huggingface.co/microsoft/maira-2-sae。
引用
@article{arxiv.2507.12950,
title = {Insights into a radiology-specialised multimodal large language model with sparse autoencoders},
author = {Kenza Bouzid and Shruthi Bannur and Felix Meissen and Daniel Coelho de Castro and Anton Schwaighofer and Javier Alvarez-Valle and Stephanie L. Hyland},
journal= {arXiv preprint arXiv:2507.12950},
year = {2025}
}
备注
Actionable Interpretability Workshop at ICML 2025. 24 pages, 7 figures, 5 tables