Oryx MLLM: 任意分辨率下的按需时空理解
计算机视觉与模式识别
2025-02-28 v4
摘要
视觉数据呈现出多种形态,从仅含几像素的小图标到跨越数小时的长视频。现有多模态 LLM 通常将这些视觉输入标准化为固定分辨率供视觉编码器使用,并为 LLM 产生相似数量的 token。这种做法在多模态理解和处理输入(无论是长时长还是短时长视觉内容)方面都不够理想。为解决此问题,我们提出 Oryx,一个用于图像、视频和多视角 3D 场景时空理解的统一多模态架构。Oryx 提供一种按需解决方案,能够无缝且高效地处理任意空间尺寸和时长的视觉输入,核心创新包括:1) 预训练的 OryxViT 模型,可将任意分辨率的图像编码为 LLM 友好的视觉表示;2) 支持按需进行 1 倍至 16 倍压缩的动态压缩模块。这些设计使 Oryx 能够容纳极长的视觉上下文(如视频),在低分辨率和高压缩率下保持处理能力,同时为面向原生分辨率、无压缩的文档理解等任务保持高识别精度。除架构改进外,完善的数据策划和针对长上下文检索和时空感知数据的专项训练也帮助 Oryx 在图像、视频和 3D 多模态理解方面取得了强大的综合能力。我们的工作已开源,地址为 https://github.com/Oryx-mllm/Oryx。
引用
@article{arxiv.2409.12961,
title = {Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution},
author = {Zuyan Liu and Yuhao Dong and Ziwei Liu and Winston Hu and Jiwen Lu and Yongming Rao},
journal= {arXiv preprint arXiv:2409.12961},
year = {2025}
}
备注
Accepted to ICLR 2025