中文

掌握复杂问题的 ABCD:基于答案的声明分解用于细粒度自评估

计算与语言 2023-05-25 v1

摘要

在回答复杂问题时,大语言模型(LLMs)可能生成不满足问题所有标准的答案。尽管现有的自评估技术旨在检测此类答案是否正确,但这些技术无法确定生成答案满足了问题的哪些标准。为解决该问题,我们提出基于答案的声明分解(ABCD),一种将问题分解为一系列真/假声明的提示策略,可用于验证答案满足输入问题的哪些标准。利用分解出的 ABCD 声明,我们进行细粒度自评估。通过在三个数据集(包括新收集的难题数据集 ObscureQA)上的初步实验,我们发现 GPT-3.5 具备一定能力来判断其答案在多大程度上满足输入问题的标准,并能够揭示模型的错误与知识缺口。

关键词

引用

@article{arxiv.2305.14750,
  title  = {Mastering the ABCDs of Complex Questions: Answer-Based Claim Decomposition for Fine-grained Self-Evaluation},
  author = {Nishant Balepur and Jie Huang and Samraj Moorjani and Hari Sundaram and Kevin Chen-Chuan Chang},
  journal= {arXiv preprint arXiv:2305.14750},
  year   = {2023}
}

备注

In progress preprint