中文

DelvePO:面向灵活提示优化的方向引导自演化框架

计算机视觉与模式识别 2025-10-22 v1 人工智能

摘要

提示优化已成为一种关键方法,因其在引导大型语言模型解决各种任务方面的能力。然而,当前工作主要依赖 LLM 的随机改写能力,优化过程通常只关注特定的影响因素,这会导致容易陷入局部最优。此外,优化后提示的性能往往不稳定,这限制了其在不同任务中的可迁移性。为解决上述挑战,我们提出了 \textbf{DelvePO}(\textbf{D}irection-Guid\textbf{e}d Se\textbf{l}f-E\textbf{v}olving Framework for Fl\textbf{e}xible \textbf{P}rompt \textbf{O}ptimization),一个面向各种任务的自演化提示优化框架。在我们的框架中,我们将提示解耦为可以用于探索不同因素对不同任务影响的各个组成部分。基于此,我们引入工作记忆,使 LLM 能够缓解其自身不确定性所致的缺陷,并进一步获取关键见解,以指导生成新的提示。我们在覆盖 various 领域的不同任务上进行了大量实验,包括开源和闭源 LLM,如 DeepSeek-R1-Distill-Llama-8B、Qwen2.5-7B-Instruct 和 GPT-4o-mini。实验结果表明,DelvePO 在相同的实验设置下 consistently 优于以往的 SOTA 方法,显示现其有效性和跨任务的可迁移性。

关键词

引用

@article{arxiv.2510.18256,
  title  = {Hyperbolic Space Learning Method Leveraging Temporal Motion Priors for Human Mesh Recovery},
  author = {Xiang Zhang and Suping Wu and Weibin Qiu and Zhaocheng Jin and Sheng Yang},
  journal= {arXiv preprint arXiv:2510.18256},
  year   = {2025}
}

备注

Accepted by ICME2025