中文

基于 Minecraft 建造者对话智能体任务的 LLM 基准测试

计算与语言 2024-07-18 v1

摘要

本文提出了将 Minecraft 建造者任务适应为评估 LLM 在空间取向任务中能力并指导建造者智能体设计的 LLM 基准测试方法。以往的工作提出了各种复杂结构的语料库和人工编写的指令。我们则尝试为测试建造者智能体提供一套由 distinct 任务组成的综合性人造基准,涵盖常见的建造操作。我们认为,这种方法允许我们探测不同智能体的具体优势与弱点,并测试 LLM 在挑战性空间推理和向量数学领域的能力。

关键词

引用

@article{arxiv.2407.12734,
  title  = {A LLM Benchmark based on the Minecraft Builder Dialog Agent Task},
  author = {Chris Madge and Massimo Poesio},
  journal= {arXiv preprint arXiv:2407.12734},
  year   = {2024}
}