交互环境中的异构对抗性博弈
人工智能
2025-10-22 v1
摘要
自我博弈是自主技能获取的基本范式,通过自我驱动的环境探索不断提升智能体能力。传统自我博弈框架在零和�etitive 设置中利用 agent 对称性,但在具有内在不对称性的开放式学习场景中显得不足。人类教育系统体现了非对称的指令框架,教育者系统性地构建针对个体学习轨迹的挑战。核心挑战在于将这些非对称、自适应的教育机制在人工系统中实现,使其能自主生成合适的课程而无需预设任务层级。我们提出 Heterogeneous Adversarial Play (HAP),一种对抗式自动课程学习框架,将教师-学生交互形式化为 minimax 优化,其中任务生成教练与解题学习者通过对抗动态共同进化。不同于现有 ACL 方法采用静态课程或单向任务选择机制,HAP 建立双向反馈系统,使教练持续根据实时学习者绩效指标 recalibrate 任务难度。多任务学习域的实验验证表明,框架在与 SOTA 基线达到性能平衡的同时,生成的课程能提升人工智能体和人类主体的学习效果。
引用
@article{arxiv.2510.18407,
title = {Heterogeneous Adversarial Play in Interactive Environments},
author = {Manjie Xu and Xinyi Yang and Jiayu Zhan and Wei Liang and Chi Zhang and Yixin Zhu},
journal= {arXiv preprint arXiv:2510.18407},
year = {2025}
}
备注
NeurIPS 2025