通过大语言模型间的一致性提升答案可靠性
计算与语言
2025-02-25 v2 人工智能
摘要
我们提出了一种协作框架,其中包括 GPT-4-0125-preview、Meta-LLaMA-3-70B-Instruct、Claude-3-Opus 和 Gemini-1.5-Flash 等多个大语言模型用于生成和回答复杂的、没有确定性真实答案的 PhD 水平统计学问题。我们的研究考察了模型间一致性如何提高响应可靠性并识别生成问题的质量。采用卡方检验、Fleiss' Kappa 和置信区间分析,我们量化了一致性率和批判间一致性,以评估响应精确度和问题质量。关键结果表明,Claude 和 GPT-4 产生结构更好、更少模糊的问题,其模型间一致性更高,表现为更窄的置信区间和更大的与问题生成模型的一致性。相比之下,Gemini 和 LLaMA 在问题表述方面表现出更大的变异性和较低的可靠性。这些发现表明,大语言模型之间的协作互动能够提高响应可靠性,并为优化面向 AI 的协作推理系统提供了宝贵见解。
引用
@article{arxiv.2411.16797,
title = {Enhancing Answer Reliability Through Inter-Model Consensus of Large Language Models},
author = {Alireza Amiri-Margavi and Iman Jebellat and Ehsan Jebellat and Seyed Pouyan Mousavi Davoudi},
journal= {arXiv preprint arXiv:2411.16797},
year = {2025}
}
备注
14 pages, 2 figures