中文

SPA:迈向具有因果推断功能的计算友好型云 - 端协同 Seq2seq 个性化生成

计算与语言 2025-08-18 v7

摘要

大型语言模型(LLMs)在各种任务和问答中展现了卓越的能力。然而,LLMs 在低资源设备上需要大量的内存存储。更为关键的是,这些设备上的计算速度也受到严重限制。在本文中,我们提出了 SPA(Side Plugin Adaption,侧边插件适配),这是一种轻量级架构,旨在在严格的设备端计算和内存约束下实现快速的设备端推理。与其他设备端 seq2seq 生成方法相比,SPA 能在低资源约束下进行快速且稳定的推理,从而获得成本效益。我们的方法建立了云端预训练 LLMs 与设备端附加参数之间的交互,能够同时提供预训练 LLMs 的知识和特征化的个人特征。此外,SPA 提供了一个框架,将基于特征的参数保留在低计算能力设备上,而将包含通用信息的参数留在高计算能力设备上。

关键词

引用

@article{arxiv.2403.07088,
  title  = {SPA: Towards A Computational Friendly Cloud-Base and On-Devices Collaboration Seq2seq Personalized Generation with Casual Inference},
  author = {Yanming Liu and Xinyue Peng and Ningjing Sang and Yafeng Yan and Xiaolan Ke and Zhiting Zheng and Shaobo Liu and Songhang Deng and Jiannan Cao and Le Dai and Xingzu Liu and Ruilin Nong and Weihao Liu},
  journal= {arXiv preprint arXiv:2403.07088},
  year   = {2025}
}

备注

Update for details