中文

掷骰子与观前跳跃:超越 next-token 预测的创造力极限

机器学习 2025-09-01 v4 人工智能 计算与语言

摘要

我们设计了一套最小化的算法任务,这些任务是对开放性现实世界任务的松散抽象,旨在帮助我们清晰可控地量化当下语言模型的创造力极限。正如需要创造性、远见的现实任务,我们的任务需要隐式的、开放性的随机规划步骤,既能发现抽象知识图谱中新的联系(如文字游戏、类比或科研),也能构建新模式(如设计数学问题或新蛋白)。在这些任务中,我们经验性和概念性地论证了 next-token 学习的局限性;多 token 方法,即无教师训练和扩散模型,相较于产生更具多样性和原创性的输出在此方面表现更佳。其次,为了在不损害连贯性的前提下引发随机性,我们发现在输入层注入噪声(称为种子条件化)的效果,与来自输出层的温度采样相当甚至在某些条件下更好。因此,我们的工作为分析开放性创造力技能提供了一个原则性、最小化的测试基准,并为超越 next-token 学习和温度采样提供了新的论点。我们在 https://github.com/chenwu98/algorithmic-creativity 上提供了部分代码。

关键词

引用

@article{arxiv.2504.15266,
  title  = {Roll the dice & look before you leap: Going beyond the creative limits of next-token prediction},
  author = {Vaishnavh Nagarajan and Chen Henry Wu and Charles Ding and Aditi Raghunathan},
  journal= {arXiv preprint arXiv:2504.15266},
  year   = {2025}
}

备注

ICML 2025 (oral)