中文

MarineGPT:向公众解锁海洋奥秘

计算与语言 2023-10-23 v1 人工智能

摘要

大语言模型(LLMs),如 ChatGPT/GPT-4,已被证明是提升 AI 助手用户体验的有力工具。持续的研究工作提出了多模态大语言模型(MLLM),通过构建联合语义空间(如视觉-文本空间)赋予 LLMs 感知多模态输入的能力。尽管 LLMs 与 MLLMs 取得了显著成功,但在需要领域特定知识与专长的领域特定应用中探索 LLMs 和 MLLMs 的研究较少,尤其是\textbf{海洋领域}。不同于通用 MLLMs,海洋专用 MLLM 需生成更为\textbf{敏感}、\textbf{信息丰富}且\textbf{科学}的响应。本工作中,我们表明现有在海量易得通用训练数据上优化的 MLLMs 对领域特定意图的理解能力极弱,难以生成信息丰富且令人满意的响应。为解决这些问题,我们提出\textbf{MarineGPT},首个专为海洋领域设计的视觉-语言模型,向公众解锁海洋奥秘。我们提出\textbf{Marine-5M} 数据集,含逾 500 万海洋图文对,以将领域特定海洋知识注入模型并实现更好的海洋视觉与语言对齐。我们的 MarineGPT 不仅将海洋认知的边界推向公众,也为将通用助手适配至下游领域专家提供了标准协议。我们为广泛的海洋应用铺平道路,同时为学术与工业界的未来研究提供了宝贵数据与预训练模型。

关键词

引用

@article{arxiv.2310.13596,
  title  = {MarineGPT: Unlocking Secrets of Ocean to the Public},
  author = {Ziqiang Zheng and Jipeng Zhang and Tuan-Anh Vu and Shizhe Diao and Yue Him Wong Tim and Sai-Kit Yeung},
  journal= {arXiv preprint arXiv:2310.13596},
  year   = {2023}
}

备注

work in progress. Code and data will be available at https://github.com/hkust-vgd/MarineGPT