分析大语言模型指令优化在表格事实验证中的表现
计算与语言
2026-02-23 v1 编程语言
摘要
指令优化提供了一种轻量级、模型无关的方法,用于提升大型语言模型(LLM)的推理性能。本文基于 DSPy 优化框架,首次系统比较了指令优化在表格事实验证中的应用。我们评估了四种开箱即用的提示技术,涵盖文本提示和代码使用:直接预测、链式思考(CoT)、结合 SQL 工具的 ReAct 以及集成 Python 执行的 CodeAct。我们在四个基准测试和三个模型系列上研究了来自 DSPy 框架的三个优化器——COPRO、MiPROv2 和 SIMBA。我们发现,指令优化在验证准确率上始终能带来提升,其中 MiPROv2 在 CoT 上获得最稳定的增益,SIMBA 在 ReAct 智能体方面提供的最大收益,尤其在大型模型规模下表现更佳。行为分析揭示,SIMBA 通过应用启发式方法,鼓励更直接的推理路径,从而提升了 CoT 推理中的数值比较能力,帮助 ReAct 智能体避免不必要的工具调用。在不同的提示技术之间,CoT 在表格事实检查中仍然有效,尤其是对于较小的模型。尽管使用大型模型构建的 ReAct 智能体可以实现具竞争力的性能,但需要精心的指令优化。
引用
@article{arxiv.2602.17937,
title = {Analyzing LLM Instruction Optimization for Tabular Fact Verification},
author = {Xiaotang Du and Giwon Hong and Wai-Chung Kwan and Rohit Saxena and Ivan Titov and Pasquale Minervini and Emily Allaway},
journal= {arXiv preprint arXiv:2602.17937},
year = {2026}
}