中文

超越单一路径:评估和增强交互式 LLM 智能体中的发散思维

计算与语言 2026-05-28 v1

摘要

发散思维是创造性的一个核心维度,但现有的大语言模型(LLM)评估将其视为单轮文本生成,未能捕捉智能体在迭代交互中推理的方式。为此,我们引入 MUTATE,一个旨在评估智能体级发散思维的交互式基准,分为两个层次:路径层面(path-level),其中智能体发现多个通往同一目标的备选路径;以及行动层面(action-level),其中单个动作需要非典型的、机制性转移的对象用途。不同于仅关注成功的评估,MUTATE 对完成的路径和离路径尝试进行评分,捕捉传统成功率会忽略的发散推理。我们的实验显示,前沿 LLM 在 MUTATE 上的表现显示现有框架存在结构性盲点:当面临immediate convergence pressure时,模型倾向于陷入immediate action fixation,未能提高行动层面的发散性。为克服这一问题,我们提出了 ReDNA,通过分离无约束的发散候选生成与收敛约束选择来实现。ReDNA 在两个发散层面上均显著优于先前方法,并在外部创意环境中有效泛化。我们也确认其成功归因于对韧性发散推理的质性提升,而非简单的环境探索。

关键词

引用

@article{arxiv.2605.28465,
  title  = {Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents},
  author = {Jihyeong Park and Ingeol Baek and Jeonghyun Park and Hwanhee Lee},
  journal= {arXiv preprint arXiv:2605.28465},
  year   = {2026}
}

备注

28 pages, 16 figures, 19 tables