高分辨率推理的图像分块:平衡局部细节与全局上下文
计算机视觉与模式识别
2025-12-15 v1 人工智能
摘要
可重复性仍然是科学进步的基石,但复杂的多模态模型往往缺乏透明的实现细节和可访问的训练基础设施。在本工作中,我们对 Monkey 视觉-语言模型(VLM)(Li et al. 2023b,发表于 CVPR24)进行了详细的复现和批判性分析,这是一种通过图像分块实现高分辨率图像理解的最新方法。原论文提出将大图像分割为分块,以恢复细粒度的视觉细节,同时保持计算效率。我们的研究使用开放检查点复现了这一策略,并重新实现了训练流水线。我们确认了原 Monkey VLM 工作的关键发现,即分块能有效恢复局部细节。然后我们进一步扩展了这项工作,通过研究全局上下文的纳入效果,为未来高分辨率多模态建模提供了实用见解。然而,我们也报告了结果的偏差,这些效应的幅度高度依赖于任务类型和分块粒度。
引用
@article{arxiv.2512.11167,
title = {Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context},
author = {Anatole Jacquin de Margerie and Alexis Roger and Irina Rish},
journal= {arXiv preprint arXiv:2512.11167},
year = {2025}
}
备注
Accepted in AAAI 2025 Workshop on Reproducible AI