等价标记:LLM 中长提示词的单标记替换
计算与语言
2025-12-01 v1
摘要
精心设计的系统提示词在引导 LLM 智能体行为方面发挥着关键作用,但其巨大的长度带来了显著的缺点,包括推理延迟增加、计算成本提升以及有效上下文长度缩减。这引发了一个问题:如此冗长的提示词能否通过保持其对下游任务的行为效应来实现大幅度的标记数缩减?为实现此目标,我们提出一种轻量级三阶段训练框架,通过学习单个特定于提示词的等价行为标记([BE])来实现。该框架首先通过重建来训练 [BE] 编码原始系统提示词的自然语言内容,然后将提示词的下游行为蒸馏到该单个标记中。重要的是,我们的方法无需访问模型内部、无需辅助压缩模型、无需标记响应数据。经验评估表明,单个 [BE] 标记可实现至多 3000 倍的提示词长度缩减,同时保留约 98% 的下游性能。显著降低了推理成本,几乎完全保留了用于用户输入的上下文窗口。
引用
@article{arxiv.2511.23271,
title = {Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs},
author = {Jiancheng Dong and Pengyue Jia and Jingyu Peng and Maolin Wang and Yuhao Wang and Lixin Su and Xin Sun and Shuaiqiang Wang and Dawei Yin and Xiangyu Zhao},
journal= {arXiv preprint arXiv:2511.23271},
year = {2025}
}
备注
15 pages, 5 figures