中文

基于两两自评估的理由感知答案验证

计算与语言 2024-10-28 v2

摘要

答案验证通过识别大型语言模型(LLM)生成的候选解中的正确解来实现。当前方法通常仅根据最终答案是否与金标准答案匹配来标记解为正确或错误,忽略了导致正确答案的解中潜在的理由缺陷,从而削弱了验证器区分合理与不合理理由的能力。我们通过实证研究表明,在 StrategyQA 中,仅有 19% 的 LLM 生成的解在答案正确时具有有效的理由,这导致验证器不可靠。此外,我们展示了在有效理由上训练验证器可显著提高其区分有效与无效理由的能力。为无需额外人工监督地构建更好的验证器,我们引入 REPS(Rationale Enhancement through Pairwise Selection,即基于两两自评估增强理由的方法),通过对同一 LLM 生成的解进行迭代式的两两自评估来从候选解中选择有效理由。使用 REPS 选择的解训练的验证器在三个推理基准(ARC-Challenge、DROP 和 StrategyQA)上优于采用常规训练方法训练的验证器。我们的结果表明,训练可靠的验证器需要确保最终答案的正确性,同时确保理由的有效性,这对于帮助人类解决复杂推理任务的模型至关重要。

关键词

引用

@article{arxiv.2410.04838,
  title  = {Rationale-Aware Answer Verification by Pairwise Self-Evaluation},
  author = {Akira Kawabata and Saku Sugawara},
  journal= {arXiv preprint arXiv:2410.04838},
  year   = {2024}
}

备注

EMNLP 2024