中文

推理是否帮助 LLM 智能体玩《龙与地下城》?一次提示工程实验

计算与语言 2025-10-22 v1

摘要

本文探讨了大型语言模型(LLM)和推理技术如何用于预测《龙与地下城》(D&D)玩家行为,并将其格式化为 Avrae Discord 机器人命令。我们使用 FIREBALL 数据集,对一种推理模型(DeepSeek-R1-Distill-LLaMA-8B)和一种指令模型(LLaMA-3.1-8B-Instruct)进行命令生成评估。我们的发现表明,为模型提供具体指令的重要性,甚至是提示中单句的变化都可能显著影响模型的输出,而指令模型在此任务中足以胜任,相较于推理模型。

关键词

引用

@article{arxiv.2510.18112,
  title  = {Does Reasoning Help LLM Agents Play Dungeons and Dragons? A Prompt Engineering Experiment},
  author = {Patricia Delafuente and Arya Honraopatil and Lara J. Martin},
  journal= {arXiv preprint arXiv:2510.18112},
  year   = {2025}
}

备注

Published at the Wordplay: When Language Meets Games Workshop (EMNLP 2025)