ReCollab:基于检索增强的LLM用于合作性临近队友建模
多智能体系统
2025-12-30 v1 人工智能
机器学习
摘要
临近队伙(AHT)要求代理推断以前未遇见的队友的行为并据此调整其策略。常规方法通常依赖固定的概率模型或分类器,这些模型在部分可观测性和有限互动下可能不稳健。大型语言模型(LLM)提供了一种灵活的替代方案:通过将短暂的行为痕迹映射到高水平假设,他们可以作为队友行为的世界模型。我们引入了\Collab,一个基于语言的框架,用于使用从轨迹特征派生的行为 rubric 对合作伙伴类型进行分类,并将其扩展为\ReCollab,该框架集成了检索增强生成(RAG)以通过示例轨迹稳定推断。在合作的 Overcooked 环境中,\Collab 有效地区分了队友类型,而\ReCollab 在各种布局下一致性地改进了适应性,实现了分类准确率和回报之间的Pareto最优权衡。这些发现表明了 LLM 作为 AHT 行为世界模型的潜力,并突显了在具有挑战性协调环境中检索 grounding 的重要性。
关键词
引用
@article{arxiv.2512.22129,
title = {ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling},
author = {Conor Wallace and Umer Siddique and Yongcan Cao},
journal= {arXiv preprint arXiv:2512.22129},
year = {2025}
}