基座模型自我对弈:通过基座模型实现开放性策略创新
机器学习
2025-07-10 v1 人工智能
摘要
多智能体相互作用长期以来推动了创新,从自然界的捕食者-猎物动态到太空竞赛。自我对弈(SP)算法试图通过对抗不断提升的对手来实现这一动力,从而在学习高质量解决方案方面构建隐式课程。然而,SP 常常难以产生多样化的解决方案,且容易陷入局部最优行为。我们引入了基座模型自我对弈(FMSP),这是一种新方向,利用基座模型(FMs)的代码生成能力和广泛知识来克服这些挑战,通过在策略空间中跨越局部最优来实现突破。我们提出了一系列方法:(1) 基础基座模型自我对弈(vFMSP),持续通过竞争性自我对弈细化智能体策略;(2) 新奇搜索自我对弈(NSSP),构建多样化的策略群体,忽略绩效;(3) 最具前景的变体,质量-多样性自我对弈(QDSP),通过结合 NSSP 的多样性和 vFMSP 的细化,创建一组高质量的策略。我们在 Car Tag—a 个连续控制追逐逃脱情境中评估了 FMSP,在 Gandalf——一个简单 AI 安全模拟中测试,其中攻击者试图破解 LLM 的防御。在 Car Tag 中,FMSP 探索了各种强化学习、树搜索和启发式方法等。就发现的策略质量而言,ouralgo 和 vFMSP 超越了强人类设计策略。在 Gandalf 中,FMSP 能够成功地自动化红队测试,突破并破坏六个逐步增强的防御水平。此外,FMSP 还能自动修复所发现的漏洞。总体而言,FMSP 代表了一个鼓舞人心的新研究前沿,通过基座模型改进自我对弈,开启了通往更具创造性和开放性策略发现的新路径。
引用
@article{arxiv.2507.06466,
title = {Foundation Model Self-Play: Open-Ended Strategy Innovation via Foundation Models},
author = {Aaron Dharna and Cong Lu and Jeff Clune},
journal= {arXiv preprint arXiv:2507.06466},
year = {2025}
}
备注
67 pages, accepted to RLC 2025