CliqueParcel:一种联合优化效率与忠实度的大型语言模型提示批处理方法
计算与语言
2024-02-26 v1 人工智能
机器学习
摘要
大型语言模型 (LLMs) 已成为近期研究的关键。然而,在推理过程中,LLMs 仍然需要大量资源。在本文中,我们提出了 CliqueParcel,这是一种旨在通过提示批处理提高 LLMs 效率的方法。现有的优化推理效率的策略往往以牺牲输出质量为代价,导致输出折扣问题。这一问题可能导致准确率降低或输出不够详细。CliqueParcel 是我们应对这一挑战的方案。在确保准确率并最小化与原始输出的偏差(即忠实度)的同时,我们的方法显著提高了推理效率。为了奠定基础,我们首先重新定义了效率度量,排除了因长度缩短而导致的运行时间减少。然后,我们提供了效率与忠实度之间的全面权衡,以阐明“输出折扣”问题的本质。在 CliqueParcel 框架内,我们提出了多种批处理子方法,并讨论了它们适用的具体场景。在评估期间,CliqueParcel 在八个广泛认可的数据集上进行了测试,这些数据集可分为三类:阅读理解、开源问答和推理。我们的实验探索了 CliqueParcel 的性能,包括效率、忠实度以及两者之间的权衡。这项工作为推理效率提供了新的见解,并展示了令人期待的性能。
引用
@article{arxiv.2402.14833,
title = {CliqueParcel: An Approach For Batching LLM Prompts That Jointly Optimizes Efficiency And Faithfulness},
author = {Jiayi Liu and Tinghan Yang and Jennifer Neville},
journal= {arXiv preprint arXiv:2402.14833},
year = {2024}
}