中文

InfoSynth:面向 LLM 的信息引导基准合成框架

计算与语言 2026-05-27 v2

摘要

大型语言模型(LLM)在推理和代码生成方面已展示出显著的进展,但高效创建新基准以评估这些能力仍是一个挑战。传统的基准创建依赖人工劳动,这既昂贵又耗时。此外,现有的基准常常污染 LLM 训练数据, necessitating 开发新的、多样化的基准以准确评估其真实能力。本工作引入 InfoSynth,一种基于信息论原则引导自动生成和评估推理基准的新型框架。我们提出基于 KL 散度和熵的指标,用于在不依赖高成本模型评估的情况下量化基准的新颖性和多样性。基于该框架,我们开发了一个端到端的管道,从种子数据集中使用遗传算法和迭代代码反馈合成稳健的 Python 编码问题。该方法在 97% 的情况下生成准确的测试用例和解决方案,并且合成的基准持续表现出高于先前工作的更高难度。此外,我们的算法提供了控制生成问题新颖性/多样性和难度度的方法。InfoSynth 为构建面向 LLM 的高质量、具挑战性的编码基准提供了一个可扩展、自验证的管道。项目页面:https://ishirgarg.github.io/infosynth_web/

关键词

引用

@article{arxiv.2601.00575,
  title  = {InfoSynth: Information-Guided Benchmark Synthesis for LLMs},
  author = {Ishir Garg and Neel Kolhe and Xuandong Zhao and Dawn Song},
  journal= {arXiv preprint arXiv:2601.00575},
  year   = {2026}
}