中文

Weak-eval-Strong:利用情境谜题评估和激发大语言模型的侧向思维

计算与语言 2024-10-10 v1 人工智能 计算机视觉与模式识别

摘要

尽管 NLP 领域的进步显著提升了大型语言模型(LLMs)在需要垂直思维任务上的性能,但其侧向思维能力仍未得到充分探索且难以衡量,因创造性思维过程的复杂性以及相关数据稀缺。为此,我们引入 SPLAT—a 个利用情境谜题评估和激发 LLMs 侧向思维的基准。该基准包含 975 个分级情境谜题,覆盖三个难度等级,采用新的多轮玩家-裁判框架代替传统基于模型的评估,后者常需更强的评估模型。该框架模拟交互式游戏:模型(玩家)向评估模型(裁判)提问关于不完整故事的问题以推断完整情景。裁判依据详细参考情境或评估玩家预测是否符合参考情境作答。该方法减轻对更强评估模型的依赖,使能够评估最先进的 LLMs。实验表明,像 WizardLM-2 这样的鲁棒评估模型在中间问题解答和最终情景准确性方面与人类判断高度一致,达到80%以上一致性——与人类之间一致性水平相似。此外,将本基准的数据和推理过程应用于其他侧向思维相关基准(如 RiddleSense 和 BrainTeaser),可提升性能。这表明该基准有效评估和激发 LLMs 的侧向思维能力。代码地址:https://github.com/chenqi008/LateralThinking

关键词

引用

@article{arxiv.2410.06733,
  title  = {Weak-eval-Strong: Evaluating and Eliciting Lateral Thinking of LLMs with Situation Puzzles},
  author = {Qi Chen and Bowen Zhang and Gang Wang and Qi Wu},
  journal= {arXiv preprint arXiv:2410.06733},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024