中文

反馈下降:通过成对比较实现开放式文本优化

机器学习 2026-01-01 v2

摘要

我们提出了 Feedback Descent—a一种通过结构化文本反馈优化文本制品(如提示词、代码和分子)的框架,而不是仅依赖标量奖励。通过保留详细的批评而不是将其压缩为二进制偏好,Feedback Descent 扩宽了偏好学习中的信息瓶颈,使其能够在文本空间而不是权重空间中进行有针对性的优化。我们展示,在上下文学习中,结构化反馈可转换为类似梯度的信息,从而实现有针对性的编辑。与先前将判断压缩为单个比特的方法不同,我们的评估器将每个比较配对与文本反馈,后者作为高带宽监督。该迭代循环完全在推理时间完成,不修改任何模型权重,且具有任务中立性。我们在三个多样化领域评估了 Feedback Descent,发现其优于最先进的提示优化方法(GEPA)、强化学习方法(GRPO、REINVENT),甚至是专门的基于图的分子优化器。在 DOCKSTRING 分子发现基准中,Feedback Descent 识别出的新药样品物质超过了拥有超过 26 万 种化合物的数据库中 99.9 百分位的化合物。

关键词

引用

@article{arxiv.2511.07919,
  title  = {Feedback Descent: Open-Ended Text Optimization via Pairwise Comparison},
  author = {Yoonho Lee and Joseph Boen and Chelsea Finn},
  journal= {arXiv preprint arXiv:2511.07919},
  year   = {2026}
}