从语言模型推理专家混合中收获更多(MoRE)
计算与语言
2023-10-23 v2 人工智能
摘要
尽管近期的大语言模型(LLMs)在各种问答(QA)数据集上有所改进,单一模型仍难以泛化到需要不同推理能力的题型。我们提供了实证证据,表明最先进的 LLMs 在提示中未见过的推理类型上泛化能力较差。为此,我们提出推理专家混合(Mixture-of-Reasoning-Experts, MoRE)框架,集成多个专门化的语言模型。我们用针对不同类型推理(包括事实、多跳、数学和常识推理)优化的提示来专门化骨干语言模型。我们的核心见解是利用专门化专家之间的一致性为每道题选择最佳答案,或选择弃答。这使得 MoRE 在来自四种推理类型的 12 个 QA 数据集集合上比任何单一专门化模型具有更高准确率。除泛化性外,MoRE 的可解释设计在不引入专家间一致性的基线之上改进了选择性问答结果。该框架也更可解释且对 QA 输出的人类使用者更有用。我们的人工研究证实,呈现专家预测与答案选择过程有助于标注者更准确地校准何时信任系统输出。我们发布所有代码与数据以促进未来工作。
引用
@article{arxiv.2305.14628,
title = {Getting MoRE out of Mixture of Language Model Reasoning Experts},
author = {Chenglei Si and Weijia Shi and Chen Zhao and Luke Zettlemoyer and Jordan Boyd-Graber},
journal= {arXiv preprint arXiv:2305.14628},
year = {2023}
}
备注
EMNLP 2023 Findings