OmniDataComposer:一种用于多模态数据融合与无限数据生成的统一数据结构
计算机视觉与模式识别
2023-08-21 v2 机器学习
多媒体
声音
音频与语音处理
摘要
本文提出 OmniDataComposer,一种用于多模态数据融合与无限数据生成的创新方法,旨在精炼并简化不同数据模态之间的交互。其核心突破在于引入了一种能够处理和合并包括视频、音频和文本在内的多模态数据输入的统一数据结构。我们设计的算法利用了视频/图像字幕提取、密集字幕提取、自动语音识别(ASR)、光学字符识别(OCR)、Recognize Anything Model(RAM)和对象跟踪等多种操作的进展。OmniDataComposer 能够识别超过 6400 类对象,大幅拓宽了视觉信息的范围。它融合了这些不同模态,促进模态间的相互增强,并便于跨模态数据校正。\textbf{最终输出将每个视频输入转化为详尽的序列文档},实质上将视频转写为完整的叙述,使其更易于被大语言模型处理。未来的前景包括为每种模态优化数据集以鼓励无限数据生成。这一坚实基础将为 ChatGPT 等模型提供宝贵的洞察,使其能够为视频字幕生成更高质量的数据集,并简化基于视频内容的问答任务。OmniDataComposer 开创了多模态学习的新阶段,为增强 AI 对复杂真实世界数据的理解与生成赋予了巨大潜力。
引用
@article{arxiv.2308.04126,
title = {OmniDataComposer: A Unified Data Structure for Multimodal Data Fusion and Infinite Data Generation},
author = {Dongyang Yu and Shihao Wang and Yuan Fang and Wangpeng An},
journal= {arXiv preprint arXiv:2308.04126},
year = {2023}
}