中文

FlexModel:一个面向分布式大语言模型可解释性的框架

机器学习 2023-12-07 v1 人工智能 计算与语言 分布式、并行与集群计算

摘要

随着大语言模型的发展,其参数现已达到数十亿,训练和部署的硬件先决条件也相应增加。尽管现有工具促进了模型并行化和分布式训练,但对于可解释性和负责任的人工智能技术至关重要的更深层模型交互,仍然需要全面的分布式计算知识。这常常阻碍了具有机器学习专业知识但分布式计算背景有限的研究人员的贡献。为应对这一挑战,我们提出了FlexModel,这是一个软件包,为与分布在多GPU和多节点配置上的模型进行交互提供了简化的接口。该库与现有的模型分布库兼容,并封装了PyTorch模型。它公开了用户可注册的HookFunctions,以促进与分布式模型内部的直接交互,弥合了分布式与单设备模型范式之间的鸿沟。FlexModel主要通过使模型交互民主化来增强可访问性,并促进大规模神经网络领域更具包容性的研究。该软件包可在 https://github.com/VectorInstitute/flex_model 找到。

关键词

引用

@article{arxiv.2312.03140,
  title  = {FlexModel: A Framework for Interpretability of Distributed Large Language Models},
  author = {Matthew Choi and Muhammad Adil Asif and John Willes and David Emerson},
  journal= {arXiv preprint arXiv:2312.03140},
  year   = {2023}
}

备注

14 pages, 8 figures. To appear at the Socially Responsible Language Modelling Research (SoLaR) Workshop, 37th Conference on Neural Information Processing Systems (NeurIPS 2023)