TextualVerifier:逐步验证 TextGrad
计算与语言
2025-11-07 v1
摘要
TextGrad 是一种新颖的文本基自动微分方法,使复合 AI 系统能够无需显式数值方程即可进行优化。然而,其目前缺乏确保文本决策推理有效性的自验证机制。本研究引入 TextualVerifier,一种利用链式思考推理和大语言模型多数投票的验证框架,以弥补这一验证空白。TextualVerifier 实现四个阶段的工作流程:链式思考分解、变体生成、多数投票和共识聚合。它以非侵入方式集成于 TextGrad 的损失函数和优化结果验证阶段。对 Gemini 1.5 Pro 模型进行实验评估,分为两个阶段:(1)在 PRM800K 上进行独立评估;(2)与 TextGrad 集成评估于 GPQA-Diamond、MMLU-ML 和 MMLU-CP 基准测试。结果表明具有显著性改进(p < 0.001)。在第一阶段,TextualVerifier 将推理步骤的有效性提升 29%。在第二阶段,集成到 TextGrad 损失函数后,准确率从 68.2% 提升至 70.4%,提升 2.2 个百分点,平均耗时 5.9 次 LLM 调用。进一步评估 TextualVerifier 版本化,对 GPQA、MMLU-ML 和 MMLU-CP 的提升分别为 8.08、10.71 和 3.92 个百分点。因此,TextualVerifier 通过无需数值梯度的 LLM 技术,首次为 TextGrad 提供自验证框架,实现更可靠的推理,为文本优化中的验证开辟了新方向。
引用
@article{arxiv.2511.03739,
title = {TextualVerifier: Verify TextGrad Step-by-Step},
author = {Eugenius Mario Situmorang and Adila Alfa Krisnadhi and Ari Wibisono},
journal= {arXiv preprint arXiv:2511.03739},
year = {2025}
}