自执行基准:衡量大语言模型克服自身缺乏自执行能力的尝试
计算与语言
2025-08-19 v1 人工智能
摘要
大语言模型(LLMs)通常在测试其知识或推理能力的任务上进行评估。在本文中,我们探索了一种不同类型的评估:LLM 能否预测其自身响应的某些方面。由于 LLM 缺乏自执行能力,我们引入了自执行基准(Self-Execution Benchmark),该基准衡量模型预测其输出属性的能力,例如某个问题对它来说是否困难、它是否会拒绝回答,或者它可能产生何种关联。我们的实验表明,模型在该基准上普遍表现不佳,且模型规模或能力的提升并不总能带来性能的持续改善。这些结果揭示了 LLMs 在表征和推理自身行为方面存在根本性局限。
引用
@article{arxiv.2508.12277,
title = {The Self-Execution Benchmark: Measuring LLMs' Attempts to Overcome Their Lack of Self-Execution},
author = {Elon Ezra and Ariel Weizman and Amos Azaria},
journal= {arXiv preprint arXiv:2508.12277},
year = {2025}
}
备注
11 pages, 9 figures