基于字典编码与零样本学习的无损提示压缩:为高效分析重复数据铺路
计算与语言
2026-04-16 v1 人工智能
机器学习
摘要
零样本学习(in-context learning)已成为大型语言模型(LLMs)中重要的学习范式。本文我们展示了LLMs可以在零样本条件下学习编码密钥,并直接对编码表示进行分析。这一发现使无需模型微调即可实现无损提示压缩:通过字典编码,将频繁出现的子序列替换为紧凑的元标记;当提供压缩字典于系统提示中时,LLMs能够在分析过程中正确解释这些元标记,生成与未压缩输入等价的输出。我们提出了一种压缩算法,识别多尺度上的重复模式,纳入令牌节省优化准则,确保压缩措施防止字典开销超过节省幅度。该算法根据数据特征特性实现最高可达80%的压缩比。为验证LLMs在压缩条件下的分析准确性是否得以保留,我们采用解压作为代理任务,该任务具有明确无歧义的基准真值。针对LogHub 2.0基准测试,使用Claude 3.7 Sonnet进行评估,显示出基于模板的压缩实现了超过0.99的精确匹配率,算法压缩的平均Levenshtein相似度得分超过0.91,即便在压缩比为60%-80%的情况下亦如此。此外,压缩比对相似度指标的解释作用不足2%,表明解压质量取决于数据特征特性而非压缩强度。该训练-free方法可直接适用于基于API的LLMs,直接解决部署中的根本约束——token限制和API成本——从而实现大规模重复数据集的成本效益分析,即便数据模式随时间演变亦可。
引用
@article{arxiv.2604.13066,
title = {Lossless Prompt Compression via Dictionary-Encoding and In-Context Learning: Enabling Cost-Effective LLM Analysis of Repetitive Data},
author = {Andresa Rodrigues de Campos and David Lee and Imry Kissos and Piyush Paritosh},
journal= {arXiv preprint arXiv:2604.13066},
year = {2026}
}