ByteSized32:用于生成以文本游戏形式表达的任务特定世界模型的语料库与挑战任务
计算与语言
2023-10-25 v2 人工智能
摘要
在本工作中,我们研究语言模型生成可解释、可交互的科学与常识推理任务显式世界模型的能力。我们将此具体化为一个生成文本游戏的任务,以数百行 Python 代码表示。为推进该任务,我们引入 ByteSized32(代码:github.com/cognitiveailab/BYTESIZED32),一个包含 32 个以推理为核心的文本游戏、总计 20k 行 Python 代码的语料库。我们通过实证表明,GPT-4 可将此类游戏用作单次上下文学习的模板,在 28% 的情况下成功生成关于未见主题的可运行游戏。当允许其对程序错误进行自我反思时,游戏可运行性大幅提升至 57%。尽管评估仿真保真度需耗费大量人力,我们引入一套自动化指标来评估游戏保真度、技术有效性、对任务规范的遵循度以及可获胜性,并显示其与专家人工评分高度一致。我们将此作为一个挑战任务提出,以推动世界建模与代码生成交叉领域的进一步发展。
引用
@article{arxiv.2305.14879,
title = {ByteSized32: A Corpus and Challenge Task for Generating Task-Specific World Models Expressed as Text Games},
author = {Ruoyao Wang and Graham Todd and Eric Yuan and Ziang Xiao and Marc-Alexandre Côté and Peter Jansen},
journal= {arXiv preprint arXiv:2305.14879},
year = {2023}
}
备注
Accepted to EMNLP 2023