中文

OneLatent:用于视觉潜在推理的单 token 压缩

人工智能 2026-02-17 v1

摘要

链式思维 (CoT) 提示可改善推理,但通常会使推理成本增加一个数量级甚至两个数量级。为解决这些挑战,我们提出了 OneLatent—a 一个将中间推理压缩为单个潜在 token 的框架,通过来自渲染 CoT 图像和 DeepSeek-OCR 隐藏状态的监督。通过将文本步骤渲染为图像,我们获得了一个确定性的监督信号,可在无需输出冗长文本理由的情况下进行检查和审计。在各类基准测试中,OneLatent 将平均输出长度缩短了 11×11\times,仅使准确率下降 2.21%2.21\%,同时将输出 token 贡献 (OTC) 提升了 6.8×6.8\times。在长链逻辑推理中,OneLatent 在 ProntoQA 上达到 99.80%99.80\%,在 ProsQA 上达到 97.80%97.80\%,压缩比最高可达 87.4×87.4\times,支持压缩受限的泛化。

关键词

引用

@article{arxiv.2602.13738,
  title  = {OneLatent: Single-Token Compression for Visual Latent Reasoning},
  author = {Bo Lv and Yasheng Sun and Junjie Wang and Haoxiang Shi},
  journal= {arXiv preprint arXiv:2602.13738},
  year   = {2026}
}