推理是否帮助 LLM 智能体玩《龙与地下城》?一次提示工程实验
计算与语言
2025-10-22 v1
摘要
本文探讨了大型语言模型(LLM)和推理技术如何用于预测《龙与地下城》(D&D)玩家行为,并将其格式化为 Avrae Discord 机器人命令。我们使用 FIREBALL 数据集,对一种推理模型(DeepSeek-R1-Distill-LLaMA-8B)和一种指令模型(LLaMA-3.1-8B-Instruct)进行命令生成评估。我们的发现表明,为模型提供具体指令的重要性,甚至是提示中单句的变化都可能显著影响模型的输出,而指令模型在此任务中足以胜任,相较于推理模型。
引用
@article{arxiv.2510.18112,
title = {Does Reasoning Help LLM Agents Play Dungeons and Dragons? A Prompt Engineering Experiment},
author = {Patricia Delafuente and Arya Honraopatil and Lara J. Martin},
journal= {arXiv preprint arXiv:2510.18112},
year = {2025}
}
备注
Published at the Wordplay: When Language Meets Games Workshop (EMNLP 2025)