Bactrainus: 优化大语言模型用于多跳复杂问答任务
计算与语言
2025-01-14 v1 人工智能
摘要
近年来,大语言模型(LLMs)的使用显著增加,这些模型在各种通用语言任务中表现出色。然而,对其在特定领域任务(特别是需要深度自然语言理解的任务)中性能的评估较少受到关注。在本研究中,我们评估了大语言模型在执行特定领域任务时的能力,重点关注使用HotpotQA数据集的多跳问答(MHQA)问题。由于该任务需要推理和结合多个文本来源的信息,因此它作为评估这些模型语言理解能力的具有挑战性的基准。为了解决这个问题,我们设计了一个两阶段的选择器-阅读器架构,其中每个阶段使用一个独立的LLM。此外,还采用了思维链(CoT)和问题分解等方法,以研究它们对提高模型性能的影响。研究结果表明,大语言模型与这些技术的结合可以使答案查找的F1分数提高高达4%,为模型处理特定领域任务和理解复杂语言的能力提供了证据。
引用
@article{arxiv.2501.06286,
title = {Bactrainus: Optimizing Large Language Models for Multi-hop Complex Question Answering Tasks},
author = {Iman Barati and Arash Ghafouri and Behrouz Minaei-Bidgoli},
journal= {arXiv preprint arXiv:2501.06286},
year = {2025}
}