面向开放式回答的 AHP 驱动的大语言模型推理评估
计算与语言
2024-10-03 v1 人工智能
摘要
问答任务在自然语言处理 (NLP) 领域得到了广泛研究。针对开放式问题的答案高度多样且难以量化,不能简单地判定其对错,不同于具有明确答案的闭合式问题。尽管大语言模型 (LLM) 在各类任务上展现出强大的能力,但在评估开放式问题答案方面表现相对较弱。本研究提出一种方法,利用 LLM 和分析层次过程 (AHP) 来评估开放式问题的答案。我们利用 LLM 生成问题的多个评估准则。随后,对答案在每个准则下进行两两比较,并计算 AHP 中的每个答案得分。我们使用 ChatGPT-3.5-turbo 和 GPT-4 在四个数据集上进行实验。结果表明,我们的方法与人类判断更吻合。此外,我们还探讨了准则数量、模型差异以及数据集差异对结果的影响。
引用
@article{arxiv.2410.01246,
title = {AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses},
author = {Xiaotian Lu and Jiyi Li and Koh Takeuchi and Hisashi Kashima},
journal= {arXiv preprint arXiv:2410.01246},
year = {2024}
}
备注
Accepted for EMNLP 2024 Findings