中文

自监督行为克隆 Transformer 是文本游戏的路径爬行者

计算与语言 2023-12-11 v1 人工智能

摘要

在这项工作中,我们为文本游戏引入了一种自监督行为克隆 Transformer,文本游戏是虚拟环境中多步推理的挑战性基准。传统上,行为克隆 Transformer 在此类任务中表现出色,但依赖于监督训练数据。我们的方法通过探索游戏内导向奖励的轨迹(由常见宏动作序列定义)来自动生成训练数据,同时通过快速训练小型模型并评估其在未见开发游戏上的性能来确定这些轨迹的通用性和效用。通过实证分析,我们表明我们的方法能持续发现可泛化的训练数据,在三个基准文本游戏中达到监督系统约 90% 的性能。

关键词

引用

@article{arxiv.2312.04657,
  title  = {Self-Supervised Behavior Cloned Transformers are Path Crawlers for Text Games},
  author = {Ruoyao Wang and Peter Jansen},
  journal= {arXiv preprint arXiv:2312.04657},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 (Findings)