中文

文本保持的有损文本压缩:战略删除与LLM重构研究

计算与语言 2026-05-29 v1

摘要

传统无损文本压缩保留每个字节,但在自然语言上往往在实际运行环境中获得有限的收益。我们研究\emph{有损语义文本压缩},其中编码器战略性删除文本的部分内容,大型语言模型(LLM)则从保留的骨架重构原始内容。我们对一系列删除策略进行基准测试,包括均匀步长删除、单词长度导向删除(WordLen)、单词频率导向删除(WordFreq)、基于 LP 的优化删除(Opt)、使用 GPT-2 感叹度的熵基于删除,以及结合频率和感叹度信号的混合方法。在保留率 \r_{keep} \in [0.1,0.9] 的范围内,对 BBC 新闻数据集进行评估,显示三个主要发现。首先,WordFreq 是一个强大的低成本基线:尽管仅使用静态频率查找表,仍与使用更昂贵语义方法相当,而在编码器方面速度更快。其次,语义方法和混合方法在轻度至中度压缩时提供最明显的收益,而单词频率删除在最低保留率时往往更稳健。第三,QLoRA 微调获得的强大的局部解码器在与 Gemini 2.0 Flash 以及解码器专属比较中常常最强。额外的英文和中文实验表明,该整体框架在不同领域之间可迁移,而最佳删除规则仍取决于数据集。

关键词

引用

@article{arxiv.2605.29000,
  title  = {Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction},
  author = {Yuchun Zou and Junhong Tong and Jun Li},
  journal= {arXiv preprint arXiv:2605.29000},
  year   = {2026}
}