中文

利用大语言模型求解与生成 NPR 周日谜题

计算与语言 2023-06-22 v1

摘要

我们探索了大语言模型利用 PUZZLEQA(一个包含 15 年广播谜题的数据集)来求解和生成 NPR 周日谜题游戏节目谜题的能力。我们使用 PUZZLEQA 以多选和自由作答两种形式评估了四个大语言模型,并探索了两种提示工程技巧以提升自由作答表现:思维链推理与提示摘要。我们发现最先进的大语言模型能求解许多 PUZZLEQA 谜题:最佳模型 GPT-3.5 取得了 50.2% 的宽松准确率。然而,在我们的少样本谜题生成实验中,我们发现没有证据表明模型能够生成谜题:GPT-3.5 生成的谜题其答案不符合所生成的规则。谜题生成仍是未来工作中一项具有挑战性的任务。

关键词

引用

@article{arxiv.2306.12255,
  title  = {Solving and Generating NPR Sunday Puzzles with Large Language Models},
  author = {Jingmiao Zhao and Carolyn Jane Anderson},
  journal= {arXiv preprint arXiv:2306.12255},
  year   = {2023}
}

备注

To appear in the Proceedings of the 14th International Conference on Computational Creativity (ICCC)