X-modaler:一个用于跨模态分析的多功能高性能代码库
计算机视觉与模式识别
2021-08-19 v1 人工智能
计算与语言
机器学习
多媒体
摘要
随着过去十年深度学习的兴起与发展,在多媒体领域视觉与语言间跨模态分析的最先进水平被持续创新与突破稳步推进。然而,尚无开源代码库以统一、模块化的方式支持众多神经网络模型的训练与部署。本工作中,我们提出X-modaler——一个将最先进跨模态分析封装为若干通用阶段(如预处理、编码器、跨模态交互、解码器及解码策略)的多功能高性能代码库。每个阶段均具备覆盖一系列广泛采用的最先进模块的功能,并支持无缝切换。此举自然实现了图像描述、视频描述及视觉语言预训练等最先进算法的灵活构建,旨在促进研究界的快速开发。同时,由于若干阶段(如跨模态交互)中的有效模块化设计为不同视觉语言任务所共享,X-modaler可轻松扩展以支撑跨模态分析中其他任务的初创原型,包括视觉问答、视觉常识推理与跨模态检索。X-modaler为Apache许可代码库,其源代码、示例项目与预训练模型可在线获取:https://github.com/YehLi/xmodaler。
引用
@article{arxiv.2108.08217,
title = {X-modaler: A Versatile and High-performance Codebase for Cross-modal Analytics},
author = {Yehao Li and Yingwei Pan and Jingwen Chen and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:2108.08217},
year = {2021}
}
备注
Accepted by 2021 ACMMM Open Source Software Competition. Source code: https://github.com/YehLi/xmodaler