中文

eDIF:面向 LLM 远程可解释性的欧洲深层推理网络

计算与语言 2025-08-15 v1

摘要

本文提出了对欧洲深层推理网络 (eDIF) 部署的可行性研究,该网络是一种兼容 NDIF 的基础设施,旨在支持大语言模型的机制可解释性研究。欧洲广泛获取 LLM 可解释性基础设施的需求推动了这一倡议,以民主化先进模型分析能力以服务于研究社区。该项目引入了一个基于 GPU 的集群,位于安斯巴赫应用科学大学,并与合作机构互联,通过 NNsight API 实现远程模型检查。针对该平台的技术性能、可用性和科学实用性开展了结构化的试点研究,涉及来自欧洲各地的 16 名研究者。用户对模型进行干预,包括激活掩码、因果追踪和表示分析,针对模型包括 GPT-2 和 DeepSeek-R1-70B。研究结果显示,用户参与度逐步增加,平台在整个过程中保持稳定性能,并积极评价了远程实验能力。这也是围绕该平台构建用户社区的开端。已识别的局限性包括激活数据下载持续时间较长以及执行中断问题,将在未来发展的路线图中予以解决。这一倡议标志着欧洲 LLM 可解释性基础设施广泛可访问性的重要一步,并为更广泛的部署、扩展工具和持续的社区合作在机制可解释性研究中奠定了基础。

关键词

引用

@article{arxiv.2508.10553,
  title  = {eDIF: A European Deep Inference Fabric for Remote Interpretability of LLM},
  author = {Irma Heithoff. Marc Guggenberger and Sandra Kalogiannis and Susanne Mayer and Fabian Maag and Sigurd Schacht and Carsten Lanquillon},
  journal= {arXiv preprint arXiv:2508.10553},
  year   = {2025}
}

备注

9 pages