文本保持的有损文本压缩:战略删除与LLM重构研究
计算与语言
2026-05-29 v1
摘要
传统无损文本压缩保留每个字节,但在自然语言上往往在实际运行环境中获得有限的收益。我们研究\emph{有损语义文本压缩},其中编码器战略性删除文本的部分内容,大型语言模型(LLM)则从保留的骨架重构原始内容。我们对一系列删除策略进行基准测试,包括均匀步长删除、单词长度导向删除(WordLen)、单词频率导向删除(WordFreq)、基于 LP 的优化删除(Opt)、使用 GPT-2 感叹度的熵基于删除,以及结合频率和感叹度信号的混合方法。在保留率 \r_{keep} \in [0.1,0.9] 的范围内,对 BBC 新闻数据集进行评估,显示三个主要发现。首先,WordFreq 是一个强大的低成本基线:尽管仅使用静态频率查找表,仍与使用更昂贵语义方法相当,而在编码器方面速度更快。其次,语义方法和混合方法在轻度至中度压缩时提供最明显的收益,而单词频率删除在最低保留率时往往更稳健。第三,QLoRA 微调获得的强大的局部解码器在与 Gemini 2.0 Flash 以及解码器专属比较中常常最强。额外的英文和中文实验表明,该整体框架在不同领域之间可迁移,而最佳删除规则仍取决于数据集。
引用
@article{arxiv.2605.29000,
title = {Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction},
author = {Yuchun Zou and Junhong Tong and Jun Li},
journal= {arXiv preprint arXiv:2605.29000},
year = {2026}
}