$\pi$-Play:基于无外部数据的最高特权自我对弈
机器学习
2026-05-26 v2 计算与语言
摘要
深度搜索智能体已成为解决复杂信息寻求任务的有前景范例,但其训练仍面临稀疏奖励、信用分配薄弱和有限标注数据等挑战。自我对弈提供了一种降低数据依赖性的可扩展路径,但常规自我对弈仅通过稀疏结果奖励来优化学生,导致学习效率低下。本文发现,自我对弈在任务生成过程中自然会产生问题构建路径(QCP),这是一种捕获逆向解过程的中间产物。这揭示了新的特权信息来源:自我对弈可在低成本且大规模下为自我蒸馏提供高质量特权信息,而无需依赖人类反馈或精心挑选的特权信息。基于这一洞察,我们提出了特权信息自我对弈(-Play),一种新的多智能体自演化框架,结合自我对弈与自我蒸馏。在-Play中,考官生成任务并伴随 QCP,教师利用 QCP 作为特权上下文,通过自我蒸馏稠密监督学生。该设计将稀疏奖励的自我对弈转化为稠密反馈的共演变。大量实验表明,数据无关的-Play超越了完全监督的搜索智能体,并使进化效率比常规自我对弈提高 2-3 倍。代码已公开 https://github.com/zhyaoch/pi-play。
引用
@article{arxiv.2604.14054,
title = {$\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data},
author = {Yaocheng Zhang and Yuanheng Zhu and Wenyue Chong and Songjun Tu and Qichao Zhang and Jiajun Chai and Xiaohan Wang and Wei Lin and Guojun Yin and Dongbin Zhao},
journal= {arXiv preprint arXiv:2604.14054},
year = {2026}
}
备注
23 pages, 11 figures