即插即用语言模型:推理时分解语言模型中的专家
计算与语言
2025-08-22 v3 人工智能
摘要
通过大规模文本语料库和巨大参数的支持,预训练语言模型使用单一模型架构作为多任务专家运行。然而,近期研究表明,某些神经元在解决特定任务中扮演着不成比例的重要角色,这表明可以隔离任务相关的子结构,并为每个任务选择性激活。因此,我们引入了专家分解(DoE),一种新颖的框架,动态识别并激活语言模型中的任务特定专家,以在不牺牲准确性的情况下降低推理成本。我们首先将任务专家定义为一组对特定任务性能有显著影响的参数,并提出一个四步即插即用过程:(1)接收用户请求,(2)识别对应的任务专家,(3)使用专家定位模型进行推理,(4)恢复原始模型并等待下一个任务。通过归因方法和提示微调,DoE隔离了任务相关神经元,在保持任务性能的同时最小化计算开销。我们假设一个场景,其中语言模型接收来自五个广泛使用的自然语言理解基准的用户请求,一次处理一个任务。在此设置中,我们证明DoE在65%剪枝率下实现了高达1.73倍的推理加速,且不损失准确性。与各种任务专家定位方法的比较表明,DoE有效识别了任务专家,而消融研究验证了其组件的重要性。此外,我们分析了批大小、token数量和层类型对推理加速的影响,为采用DoE提供了实用见解。所提出的框架既实用又可扩展,适用于任何基于Transformer的架构,为高效的任务特定推理提供了稳健的解决方案。
引用
@article{arxiv.2404.11916,
title = {Unplug and Play Language Models: Decomposing Experts in Language Models at Inference Time},
author = {Nakyeong Yang and Jiwon Moon and Junseok Kim and Yunah Jang and Kyomin Jung},
journal= {arXiv preprint arXiv:2404.11916},
year = {2025}
}
备注
accepted to CIKM 2025