中文

立场:我们需要对生成式 AI 的算法理解

人工智能 2025-07-11 v1 机器学习

摘要

大型语言模型(LLM)到底学习到哪些算法并用于解决问题?针对这一问题的研究极少,因研究重点集中在通过规模提升性能,导致对算法性原理解答和实证研究之间存在理论和实证鸿沟。本立场论文提出了 AlgEval:一个用于系统性研究大语言模型学习和使用的框架。AlgEval 旨在揭示反映于潜在表示、注意力和推理时计算资源中的算法基本要素,以及这些要素如何组合来解决特定任务的问题。我们概述了潜在的方法路径和一个案例研究,聚焦于涌现搜索算法。我们的案例研究旨展示如何形成关于候选算法的自上而下假设,以及通过注意力模式和隐藏状态的底层分析对这些假设进行测试。对大语言模型实际解决问题方式进行严谨、系统的评估,为资源密集型的规模扩张提供了另一种路径,使领域重新导向对底层计算的原则性理解。这种算法解释为人类可理解的可解释性提供了通道,使我们能够理解模型的内部推理性能措施。这反过来可能导致更高效的训练方法和性能提升,以及面向端到端和多主体系统的新型架构。

关键词

引用

@article{arxiv.2507.07544,
  title  = {Position: We Need An Algorithmic Understanding of Generative AI},
  author = {Oliver Eberle and Thomas McGee and Hamza Giaffar and Taylor Webb and Ida Momennejad},
  journal= {arXiv preprint arXiv:2507.07544},
  year   = {2025}
}

备注

Accepted at ICML 2025 as a Spotlight Position Paper