KerasCV 和 KerasNLP:视觉与语言能力增强包
人工智能
2024-06-06 v3 计算机视觉与模式识别
机器学习
软件工程
摘要
我们介绍了 Keras 领域包 KerasCV 和 KerasNLP,它们是 Keras API 在计算机视觉和自然语言处理工作流程上的扩展,能够在 JAX、TensorFlow 或 PyTorch 上运行。这些领域包旨在实现快速实验,重点关注易用性和性能。我们采用模块化、分层设计:在库的最低抽象级别,我们提供用于创建模型和数据预处理流程的构建块;在库的最高抽象级别,我们为流行的架构(如 Stable Diffusion、YOLOv8、GPT2、BERT、Mistral、CLIP、Gemma、T5 等)提供预训练的“任务”模型。任务模型具有内置的预处理、预训练权重,并且可以在原始输入上进行微调。为了实现高效训练,我们支持所有模型的 XLA 编译,并通过使用 tf.data API 的编译 TensorFlow 操作图运行所有预处理。这些库完全开源(Apache 2.0 许可证),可在 GitHub 上获取。
引用
@article{arxiv.2405.20247,
title = {KerasCV and KerasNLP: Vision and Language Power-Ups},
author = {Matthew Watson and Divyashree Shivakumar Sreepathihalli and Francois Chollet and Martin Gorner and Kiranbir Sodhia and Ramesh Sampath and Tirth Patel and Haifeng Jin and Neel Kovelamudi and Gabriel Rasskin and Samaneh Saadat and Luke Wood and Chen Qian and Jonathan Bischof and Ian Stenbit and Abheesht Sharma and Anshuman Mishra},
journal= {arXiv preprint arXiv:2405.20247},
year = {2024}
}
备注
Submitted to Journal of Machine Learning Open Source Software