Ground-Compose-Reinforce:使用有限数据在代理行为中对齐语言
机器学习
2025-10-28 v2 人工智能
摘要
在构建能够通过语言与人类或其他代理人交互的situated代理时,对语言进行感知和动作的对齐是一个关键挑战。过去,解决这一挑战需要手动设计语言对齐或精选大量将语言与环境关联起来的数据。我们提出了 Ground-Compose-Reinforce,一个用于从高级任务规范直接训练 RL 代理的端到端、类神经符号框架——无需手动设计奖励函数或其他特定于领域的oracle,也无需大量数据集。这些任务规范采取奖励机器 (Reward Machine) 的形式,这些机器是捕获高级任务结构的自动机表示,某些情况下可自动从自然语言中形式化。关键的是,我们展示了奖励机器可以通过利用组合性质来利用有限数据进行对齐。仅使用 350 条标记的预训练轨迹,我们的框架在高级规范中诱发出复杂行为——包括在预训练中从未出现的行为,而非组合方法则失败。
引用
@article{arxiv.2507.10741,
title = {Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data},
author = {Andrew C. Li and Toryn Q. Klassen and Andrew Wang and Parand A. Alamdari and Sheila A. McIlraith},
journal= {arXiv preprint arXiv:2507.10741},
year = {2025}
}
备注
NeurIPS 2025