中文

重新思考用于基于大语言模型的自动算法设计的代码相似性

人工智能 2026-03-04 v1

摘要

基于大语言模型的自动算法设计(LLM-AAD)的兴起,通过自主生成专家级算法的代码实现,改变了算法开发方式。与传统的专家驱动算法开发不同,在LLM-AAD范式中,算法背后的主要设计原则通常隐式地嵌入在生成的代码中。因此,直接从代码评估算法相似性,区分真正的算法创新与纯粹的语法变化,变得至关重要。虽然存在各种代码相似性度量,但它们未能捕捉算法相似性,因为它们关注的是表面语法或输出等价性,而非底层的算法逻辑。我们提出了BehaveSim,一种新颖的方法,通过问题求解行为的视角来衡量算法相似性,该行为被表示为执行过程中产生的一系列中间解,称为问题求解轨迹(PSTrajs)。通过使用动态时间规整(DTW)量化PSTrajs之间的对齐程度,BehaveSim能够区分尽管在语法或输出层面相似但逻辑不同的算法。我们展示了它在两个关键应用中的实用性:(i) 增强LLM-AAD:将BehaveSim集成到现有的LLM-AAD框架(例如FunSearch, EoH)中,可以促进行为多样性,从而显著提高三个AAD任务的性能。(ii) 算法分析:BehaveSim通过行为对生成的算法进行聚类,从而能够系统性地分析问题求解策略——这对于日益增长的AI生成算法生态系统来说是一个关键工具。本工作的数据和代码已在 https://github.com/RayZhhh/behavesim 开源。

关键词

引用

@article{arxiv.2603.02787,
  title  = {Rethinking Code Similarity for Automated Algorithm Design with LLMs},
  author = {Rui Zhang and Zhichao Lu},
  journal= {arXiv preprint arXiv:2603.02787},
  year   = {2026}
}

备注

Accepted to ICLR 2026