中文

CryptoX:大型语言模型组合推理评估框架

密码学与安全 2025-03-13 v2 人工智能

摘要

组合推理能力长期被视为大型语言模型LLM泛化与智能涌现的关键因素。然而,尽管已有诸多推理相关基准,LLMs的组合推理能力却鲜有被研究或量化。在本文中,我们引入CryptoX,这是一个首次将现有基准与密码学结合,用于量化LLMs组合推理能力的评估框架。基于CryptoX,我们构建了CryptoBench,将这些原则整合到多个基准中进行系统评估。我们对广泛使用的开源和闭源LLMs使用CryptoBench进行详细实验,揭示了开源与闭源LLMs之间巨大的差距。我们进一步通过深入的机械可解释性实验揭示了LLMs组合推理的内部机制,涉及子问题分解、子问题推理和总结子问题结论。通过基于CryptoBench的分析,我们强调了独立研究组合推理的价值,并强调需要提高LLMs的组合推理能力。

关键词

引用

@article{arxiv.2502.07813,
  title  = {CryptoX : Compositional Reasoning Evaluation of Large Language Models},
  author = {Jiajun Shi and Chaoren Wei and Liqun Yang and Zekun Moore Wang and Chenghao Yang and Ge Zhang and Stephen Huang and Tao Peng and Jian Yang and Zhoufutu Wen},
  journal= {arXiv preprint arXiv:2502.07813},
  year   = {2025}
}