通过符号金属语言实现 LLM 指令的语义压缩
计算与语言
2026-01-13 v1
摘要
我们提出 MetaGlyph,一种用于压缩提示语的符号语言,通过将指令编码为数学符号而非文字。不同于需要显式解码规则的系统,MetaGlyph 使用如 (成员)和 (蕴含)等符号,这些符号模型已从训练数据中理解。我们测试这些符号是否作为“指令快捷方式”被模型解释,而无需额外教学。我们在八个模型上进行评估,考量实践者关心的两个维度:规模(3B-1T 参数)和可访问性(面向本地部署的开源 vs. 专有 API)。MetaGlyph 在所有任务类型上实现 62-81% 的 token 降低。对于 API 部署,这直接转化为成本节省;对于本地部署,可减少延迟和内存压力。结果因模型而异。Gemini 2.5 Flash 在选择任务上实现 75% 的语义等价性,成员算子保真度为 49.9%。Kimi K2 对蕹含符号 () 实现 98.1% 保真度,并在符号提示下选择任务实现完美(100%)准确率。GPT-5.2 Chat 观察到最高的成员保真度(91.3%),尽管在任务类型上表现出可变的解析成功率。Claude Haiku 4.5 实现 100% 解析成功,成员保真度为 26%。在中等规模模型中,Qwen 2.5 7B 在提取任务上实现 62% 的等价性。中等规模开源模型(7B-12B)显示近乎零的算子保真度,这表明足够的规模可克服指令调校偏差,呈现倒U型关系。
引用
@article{arxiv.2601.07354,
title = {Semantic Compression of LLM Instructions via Symbolic Metalanguages},
author = {Ernst van Gassen},
journal= {arXiv preprint arXiv:2601.07354},
year = {2026}
}
备注
12 pages and 6 tables