Reka Core、Flash 和 Edge:一系列强大的多模态语言模型
计算与语言
2024-05-09 v1 计算机视觉与模式识别
摘要
我们介绍了 Reka Core、Flash 和 Edge,一系列由 Reka 从头训练的强大多模态语言模型。Reka 模型能够处理和推理文本、图像、视频和音频输入。本技术报告讨论了其中部分模型的训练细节,并提供了全面的评估结果。我们表明,Reka Edge 和 Reka Flash 不仅是 SOTA,而且优于许多大得多的模型,为其各自的算力等级带来了超常的价值。同时,我们能力最强、规模最大的模型 Reka Core 在自动评估和盲测人类评估中均接近最佳的前沿模型。在图像问答基准测试(例如 MMMU、VQAv2)上,Core 的表现与 GPT4-V 相当。同时,在多模态聊天方面,Core 在盲测第三方人类评估设置下排名第二受青睐的模型,优于 Claude 3 Opus 等其他模型。在文本基准测试上,Core 不仅在一组成熟的基准测试(例如 MMLU、GSM8K)上与其他前沿模型表现相当,而且在人类评估上优于 GPT4-0613。在视频问答上,Core 优于 Gemini Ultra。模型已在生产环境中部署于 http://chat.reka.ai 。非精选的定性示例展示也可在 http://showcase.reka.ai 找到。
引用
@article{arxiv.2404.12387,
title = {Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models},
author = {Reka Team and Aitor Ormazabal and Che Zheng and Cyprien de Masson d'Autume and Dani Yogatama and Deyu Fu and Donovan Ong and Eric Chen and Eugenie Lamprecht and Hai Pham and Isaac Ong and Kaloyan Aleksiev and Lei Li and Matthew Henderson and Max Bain and Mikel Artetxe and Nishant Relan and Piotr Padlewski and Qi Liu and Ren Chen and Samuel Phua and Yazheng Yang and Yi Tay and Yuqi Wang and Zhongkai Zhu and Zhihui Xie},
journal= {arXiv preprint arXiv:2404.12387},
year = {2024}
}