中文

面向开放式回答的 AHP 驱动的大语言模型推理评估

计算与语言 2024-10-03 v1 人工智能

摘要

问答任务在自然语言处理 (NLP) 领域得到了广泛研究。针对开放式问题的答案高度多样且难以量化,不能简单地判定其对错,不同于具有明确答案的闭合式问题。尽管大语言模型 (LLM) 在各类任务上展现出强大的能力,但在评估开放式问题答案方面表现相对较弱。本研究提出一种方法,利用 LLM 和分析层次过程 (AHP) 来评估开放式问题的答案。我们利用 LLM 生成问题的多个评估准则。随后,对答案在每个准则下进行两两比较,并计算 AHP 中的每个答案得分。我们使用 ChatGPT-3.5-turbo 和 GPT-4 在四个数据集上进行实验。结果表明,我们的方法与人类判断更吻合。此外,我们还探讨了准则数量、模型差异以及数据集差异对结果的影响。

关键词

引用

@article{arxiv.2410.01246,
  title  = {AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses},
  author = {Xiaotian Lu and Jiyi Li and Koh Takeuchi and Hisashi Kashima},
  journal= {arXiv preprint arXiv:2410.01246},
  year   = {2024}
}

备注

Accepted for EMNLP 2024 Findings