SocREval:基于苏格拉底法的大语言模型无参考推理评估
计算与语言
2024-12-19 v3 人工智能
摘要
为全面衡量当前模型处理复杂推理的能力,以可扩展方式评估其逐步推理至关重要。既有的基于参考的评估指标依赖人工标注的推理链作为参考来评判模型生成的推理链。然而,此类“金标准”人工撰写的推理链未必唯一,且其获取往往耗费人力。现有的无参考推理评估指标虽免除了将人工构建的推理链作为参考的需求,却常在评估前需用人工推导的链进行微调,使流程复杂并令其对他数据集的适应性存疑。为应对这些挑战,我们利用 GPT-4 自动评估推理链质量,从而消除在模型微调与评估环节对人工撰写推理链的依赖。借助苏格拉底法,我们开发了 SocREval(受{\bf 苏}格拉底{\bf 方}法启发的推理{\bf 评}估),一种用于无参考推理评估中提示设计的新方法。来自四个人工标注数据集的实证结果表明,SocREval 显著提升了 GPT-4 的性能,超越现有的无参考与基于参考的推理评估指标。除已证实的效力外,我们的深入分析还表明 SocREval 兼具成本高效性,且对提示撰写与样例选择具有鲁棒性。
引用
@article{arxiv.2310.00074,
title = {SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation},
author = {Hangfeng He and Hongming Zhang and Dan Roth},
journal= {arXiv preprint arXiv:2310.00074},
year = {2024}
}