中文

LLM 能否压缩(和解压)?通过可逆性评估代码理解与执行

机器学习 2026-05-05 v2 人工智能 编程语言

摘要

LLM 在代码基准测试中表现出色,但在正向和反向执行中实现一致的推理仍然难以实现。我们提出了 RoundTripCodeEval (RTCE),这是一个包含四个代码执行推理任务的基准测试,通过对四种无损压缩算法的双射保真度进行无执行、精确匹配的评估来评估往返一致性。我们在零样本提示、执行轨迹上的监督微调以及迭代自我反思下评估了最先进的 Code-LLMs。所有方法仅带来适度的改进,且没有一种方法能弥合差距,这表明当前的 LLM 缺乏可靠双向代码推理所需的内部一致性。RTCE 揭示了现有基准测试无法发现的结论:模型经常能通过单独的正向和反向任务,但在组合的往返测试中失败,暴露了相互不一致的内部表示;SFT 和自我反思在一次修订轮次后即达到饱和,表明它们无法修复根本的算法误解;并且即使在 RLE 等简单双射上失败依然存在,表明算法复杂性并非唯一的根本原因。

关键词

引用

@article{arxiv.2601.13398,
  title  = {Can LLMs Compress (and Decompress)? Evaluating Code Understanding and Execution via Invertibility},
  author = {Nickil Maveli and Antonio Vergari and Shay B. Cohen},
  journal= {arXiv preprint arXiv:2601.13398},
  year   = {2026}
}

备注

Accepted to the Findings of ACL 2026