当语言模型针对推理进行优化时, autoregression 的余温是否仍存?对 OpenAI o1 的分析
计算与语言
2024-10-07 v2 人工智能
摘要
在《Embers of Autoregression》(McCoy 等,2023)中,我们展示了几个大语言模型(LLM)存在的一些重要局限性,这些局限性可归因于其源于下一个词预测。在本研究中,我们调查了 o1——一种与以往 LLM 不同的新系统——是否仍存在这些问题。o1 在许多情况下均显著优于以往 LLM,尤其在稀有任务变体方面表现突出(例如,从列表中每个单词的第二个字母中 form acronym,而非第一个字母)。尽管如此,o1 仍显示出我们在以往系统中观察到的相同定性趋势。具体而言,o1——像以往 LLM 一样——对示例和任务的概率敏感,表现更好,所需的 "思考 token" 更少,尤其是在高概率情境下。这些结果表明,针对推理进行语言模型的优化可以缓解但可能无法完全克服语言模型的概率敏感性。
引用
@article{arxiv.2410.01792,
title = {When a language model is optimized for reasoning, does it still show embers of autoregression? An analysis of OpenAI o1},
author = {R. Thomas McCoy and Shunyu Yao and Dan Friedman and Mathew D. Hardy and Thomas L. Griffiths},
journal= {arXiv preprint arXiv:2410.01792},
year = {2024}
}
备注
6 pages; updated to fix typo in Fig 4 caption