中文

Query-OPT:通过多查询指令优化会议摘要中的大语言模型推理

计算与语言 2024-10-22 v4

摘要

本工作聚焦于基于查询的会议摘要任务,其中上下文(会议转录稿)的摘要是针对特定查询生成的。当使用大语言模型 (LLMs) 执行此任务时,即使上下文保持不变,通常也会为每个新查询触发一次对 LLM 推理端点/API 的新调用。然而,重复调用 LLM 推理端点会显著增加在生产环境中使用它们的成本,使得 LLMs 在许多实际应用场景中变得不切实际。为解决这一问题,在本文中,我们研究了是否可以将同一输入上下文的查询组合到单个提示中以最小化重复调用,并成功应用于会议摘要。在这方面,我们通过比较各种流行 LLMs(GPT-4、Gemini、Claude-3、LLaMA-2、Mistral、Phi-3 和 Qwen-2)在单查询和多查询设置下的性能进行了广泛实验。我们观察到,以预期格式生成响应的 100% 可靠性通常仅限于某些闭源 LLMs,大多数开源 LLMs 落后于此(除了少数如 Mistral 和 Phi-3 等 7B 参数量的 LLMs)。我们得出结论,多查询提示可用于显著优化会议摘要中的推理成本。

关键词

引用

@article{arxiv.2403.00067,
  title  = {Query-OPT: Optimizing Inference of Large Language Models via Multi-Query Instructions in Meeting Summarization},
  author = {Md Tahmid Rahman Laskar and Elena Khasanova and Xue-Yong Fu and Cheng Chen and Shashi Bhushan TN},
  journal= {arXiv preprint arXiv:2403.00067},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 (Industry Track)