LLM 是否可以将人类指令翻译为强化学习智能体内部出现的符号表示?
计算与语言
2025-10-29 v1 机器人学
摘要
在本研究中,我们调查了大型语言模型(LLM)是否可以将人类自然语言指令翻译成层次化强化学习中所出现的内部符号表示。我们应用一种结构化的评估框架来衡量常见 LLM(如 GPT、Claude、Deepseek 和 Grok)在 Ant Maze 和 Ant Fall 环境中,针对由层次化强化学习算法生成的不同内部符号分区的翻译性能。我们的发现表明,尽管 LLM 展示了将自然语言翻译为环境动态符号表示的某些能力,但其性能对分区粒度和任务复杂度高度敏感。结果揭示了当前 LLM 在表示对齐方面的局限性,凸显了需要进一步研究语言与内部智能体表示之间稳健对齐的需求。
引用
@article{arxiv.2510.24259,
title = {Can LLMs Translate Human Instructions into a Reinforcement Learning Agent's Internal Emergent Symbolic Representation?},
author = {Ziqi Ma and Sao Mai Nguyen and Philippe Xu},
journal= {arXiv preprint arXiv:2510.24259},
year = {2025}
}