中文

EvoEmo:面向多轮价格谈判中对抗性 LLM 智能体的进化情感策略研究

人工智能 2026-05-27 v4

摘要

最近关于大语言模型 (LLMs) 中思维链 (CoT) 推理的研究表明,智能体能够参与复杂、多轮的谈判,为智能体人工智能开辟了新途径。然而,现有的 LLM 智能体在很大程度上忽视了情感在此类谈判中的功能性作用,而是产生被动的、偏好驱动的情感反应,这使得它们容易受到对抗性对手的操纵和策略性利用。为弥补这一不足,我们提出了 EvoEmo,这是一个进化强化学习框架,用于优化谈判中的动态情感表达。EvoEmo 将情感状态转换建模为马尔可夫决策过程,并采用基于种群的遗传优化方法,在多样化的谈判场景中进化出高回报的情感策略。我们进一步提出了一个包含两种基线策略——原始策略和固定情感策略——的评估框架,用于基准测试情感感知谈判。大量实验和消融研究表明,EvoEmo 始终优于两种基线策略,实现了更高的成功率、更高的效率和更多的买方节省。这一发现突显了自适应情感表达在使 LLM 智能体更有效地进行多轮谈判中的重要性。代码可在 \href{https://github.com/Yunbo-max/EvoEmo}{\textcolor{red}{https://github.com/Yunbo-max/EvoEmo}} 获取。

关键词

引用

@article{arxiv.2509.04310,
  title  = {EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation},
  author = {Yunbo Long and Liming Xu and Lukas Beckenbauer and Yuhan Liu and Alexandra Brintrup},
  journal= {arXiv preprint arXiv:2509.04310},
  year   = {2026}
}