LiveMind:低延迟大语言模型的同步推理
人工智能
2024-11-07 v2 计算与语言
摘要
本文介绍了 LiveMind,这是一个新的低延迟大语言模型 (LLM) 推理框架,使 LLM 能够在用户输入不完整时进行推理。通过重新分配计算进程以用于输入阶段,实现了显著的延迟降低,从而大幅提升了 LLM 用户的交互体验。该框架巧妙地管理了流式输入对模型的可见性,使其能够从不完整的用户输入进行推理或等待额外内容。与针对完整用户输入的传统推理方法相比,我们的方法在 MMLU 数据集上实现了 84.0% 的响应延迟平均降低,在 MMLU-Pro 数据集上实现了 71.6% 的响应延迟降低,同时保持了可 comparable 的准确率。此外,我们的框架促进了来自不同模型的协作推理和输出。通过采用大型 LLM 进行推理和小型 LLM 进行输出,我们在 MMLU-Pro 数据集上实现了 37% 的响应延迟降低,同时较基线实现了 4.30% 的准确率提升。该提出的 LiveMind 框架推动了人机交互领域的发展,使用户与 AI 系统之间的通信更加响应且高效。
引用
@article{arxiv.2406.14319,
title = {LiveMind: Low-latency Large Language Models with Simultaneous Inference},
author = {Chuangtao Chen and Grace Li Zhang and Xunzhao Yin and Cheng Zhuo and Ulf Schlichtmann and Bing Li},
journal= {arXiv preprint arXiv:2406.14319},
year = {2024}
}