中文

别骗你朋友:通过协作自我对弈学习认知

机器学习 2025-09-01 v3 计算与语言

摘要

要成为有帮助的助手,AI代理必须意识到自身的能力与局限性。这包括在何时从参数知识作答、何时使用工具、何时信赖工具输出、何时选择回避或 hedging。通过监督式微调教授这些能力面临着巨大挑战,因为需要构建反映特定能力的示例。因此,我们提出一种根本性的新方法来教授代理认知:协作自我对弈。我们构建多代理协作系统,围绕集体实现正确答案的奖励进行设计。所需的元认知知识从交互结构中的激励机制中自然涌现。我们聚焦于小型代理社群,这些社群拥有异构工具(如语料库特定检索),因此必须协作以最大化成功率的同时最小化资源消耗。实验表明,多代理社区的集体奖励机制可诱导代理在单独部署时使用的情境下,对工具使用和选择性预测的改进策略。

关键词

引用

@article{arxiv.2503.14481,
  title  = {Don't lie to your friends: Learning what you know from collaborative self-play},
  author = {Jacob Eisenstein and Reza Aghajani and Adam Fisch and Dheeru Dua and Fantine Huot and Mirella Lapata and Vicky Zayats and Jonathan Berant},
  journal= {arXiv preprint arXiv:2503.14481},
  year   = {2025}
}

备注

CoLM 2025 camera-ready version