Lumina-OmniLV:面向通用低层视觉的统一多模态框架
计算机视觉与模式识别
2025-04-09 v2 人工智能
摘要
我们提出Lumina-OmniLV(缩写为OmniLV),一个面向低层视觉的通用多模态多任务框架,旨在解决超过100个子任务,涵盖四大类别:图像修复、图像增强、弱语义密集预测与风格化。OmniLV利用文本和视觉提示,提供灵活且用户友好的交互方式。基于扩散转换器(DiT)构建的生成先验,使该框架支持任意分辨率——在1K分辨率下实现最佳性能,同时保留细粒度细节和高保真度。通过大量实验,我们证明,独立编码文本与视觉指令,结合使用浅层特征控制进行联合训练,对于缓解任务歧义和增强多任务泛化至关重要。我们的发现还表明,将高级生成任务集成到低层视觉模型中可能妨碍细节敏感的修复。这些见解为构建更稳健和更具可泛化性的低层视觉系统铺平了道路。
引用
@article{arxiv.2504.04903,
title = {Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision},
author = {Yuandong Pu and Le Zhuo and Kaiwen Zhu and Liangbin Xie and Wenlong Zhang and Xiangyu Chen and Peng Gao and Yu Qiao and Chao Dong and Yihao Liu},
journal= {arXiv preprint arXiv:2504.04903},
year = {2025}
}