中文

TRIM:面向高性价比语言生成的词元削减与推理建模

计算与语言 2025-11-25 v5

摘要

大语言模型(LLMs)的高昂推理成本带来了挑战,尤其是对于需要生成长篇输出的任务。然而,自然语言通常包含冗余,这为优化提供了机会。我们观察到,当给予适当提示时,大语言模型能够生成精炼语言(即保留核心含义的简洁输出)。本文提出 TRIM,一种旨在节省计算成本的流水线方法,其中 LLM 在推理过程中根据上下文省略一组预定义的、语义上无关且易于推断的词。随后,一个经过专门训练、推理成本更低的较小语言模型将精炼后的答案重构为理想答案。我们的实验显示出有前景的结果,特别是在针对重构任务提出的 NaLDA 评估数据集上,GPT-4o 平均节省了 19.4% 的词元,而评估指标仅有微小下降。这表明该方法能够在语言处理任务中有效平衡效率与准确性。

关键词

引用

@article{arxiv.2412.07682,
  title  = {TRIM: Token Reduction and Inference Modeling for Cost-Effective Language Generation},
  author = {Alfredo Garrachón Ruiz and Tomás de la Rosa and Daniel Borrajo},
  journal= {arXiv preprint arXiv:2412.07682},
  year   = {2025}
}

备注

16 pages, 9 tables, 5 figures