大型多模态模型 (LMM) 与面向对象的视觉理解:目标识别、分割、编辑与生成
计算机视觉与模式识别
2026-04-21 v2
摘要
大型多模态模型 (LMM) 在通用视觉-语言理解方面取得了显著进展,但在需要精确目标级定位、细粒度空间推理和可控视觉操控的任务上仍受限。具体而言,现有系统常常难以识别正确的实例、在多次交互中保持目标身份一致,以及以高精度定位或修改指定区域。面向对象的视觉理解提供了一套原则性框架,以显式表示和操作视觉实体为基础,使多模态系统从全局场景理解扩展到目标级理解、分割、编辑和生成。本文综述了近期 LMM 与面向对象视觉交叉发展的进展。我们将文献组织为四大核心主题:对象级视觉理解、对象级指代分割、对象级视觉编辑和对象级视觉生成。我们进一步总结了支撑这些能力的关键建模范式、学习策略和评估协议。最后,讨论了包括鲁棒实例持久性、细粒度空间控制、一致的多步骤交互、统一的跨任务建模以及在分布迁移下的可靠基准测试等开放挑战和未来方向。我们希望本文为开发可扩展、精确且可信的面向对象多模态系统提供结构化视角。
引用
@article{arxiv.2604.11789,
title = {LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation},
author = {Yuqian Yuan and Wenqiao Zhang and Juekai Lin and Yu Zhong and Mingjian Gao and Binhe Yu and Yunqi Cao and Wentong Li and Yueting Zhuang and Beng Chin Ooi},
journal= {arXiv preprint arXiv:2604.11789},
year = {2026}
}
备注
38 pages, 6 figures