Octopus v4:语言模型的图谱
计算与语言
2024-05-01 v1
摘要
语言模型在广泛的应用中表现良好,但最为复杂的模型往往是专有的。例如,OpenAI 的 GPT-4 以及 Anthropic 的各种模型成本高昂且消耗大量能源。相比之下,开源社区已生产造出具有竞争力的模型,如 Llama3。此外,针对特定领域的较小语言模型(如为法律、医疗或金融任务量身定制的模型)已超过其专有模型。本文提出了一种新方法,通过运用'功能标记'整合多个针对特定任务优化的开源模型。我们新开发的Octopus v4模型利用'功能标记'智能地将用户查询导向最合适的垂直模型,并对查询进行重新格式化以实现最佳性能。Octopus v4是Octopus v1、v2和v3模型的演进版本,在选择和参数理解及重新格式化方面表现突出。此外,我们探讨了将图作为一种灵活的数据结构来有效地协调多个开源模型的可能性,充分发挥Octopus模型和'功能标记'的能力。通过使用我们开源的 GitHub (\url{https://www.nexa4ai.com/}) 尝试 Octopus v4模型 (\url{https://huggingface.co/NexaAIDev/Octopus-v4}),并致力于构建更大的语言模型图谱。在激活参数不足 10B 的模型时,我们实现了在相同水平模型中取得 SOTA 的 MMLU 分数 74.8。
引用
@article{arxiv.2404.19296,
title = {Octopus v4: Graph of language models},
author = {Wei Chen and Zhiyuan Li},
journal= {arXiv preprint arXiv:2404.19296},
year = {2024}
}