中文

PolicyEvol-Agent:基于环境感知和自我意识的理论心智演化策略

人工智能 2025-04-23 v1 机器学习

摘要

多智能体由于具备社会认知和知识检索能力,在大型语言模型(LLM)驱动的真实场景仿真中展现出显著智能。然而,现有研究在具备有效认知链(包括推理、规划、决策和反思)的智能体方面仍有限,尤其是在动态交互场景中。此外,与人类不同,基于提示的响应在不确定游戏过程中面临心理状态感知和经验校准挑战,可能导致认知偏差。鉴于上述问题,我们引入PolicyEvol-Agent,一个综合性的LLM驱动框架,通过系统获取他人意图并自适应优化非理性策略以实现持续改进。具体而言,PolicyEvol-Agent首先获取反思模式,然后整合理论心智(Theory of Mind)中的多种认知操作,包括内外部视角。仿真结果表明,PolicyEvol-Agent超越基于强化学习的模型和基于智能体的方法,在最终游戏胜利方面表现优异。此外,策略演化机制揭示了在自动和人类评估中动态指导调整的有效性。

关键词

引用

@article{arxiv.2504.15313,
  title  = {PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind},
  author = {Yajie Yu and Yue Feng},
  journal= {arXiv preprint arXiv:2504.15313},
  year   = {2025}
}