DynRefer:通过动态分辨率探索区域级多模态任务
计算机视觉与模式识别
2025-03-04 v2
摘要
多模态模型的基本任务之一是将指派的图像区域翻译为人类偏好的语言描述。然而,现有方法忽略了不同任务对分辨率适应性需求,这会阻碍其找到精确的语言描述。在本研究中,我们提出了 DynRefer 方法,通过模拟人类视觉认知的分辨率适应性来实现高精度区域级指派。在训练期间,DynRefer 以随机方式将多模态任务的语言描述与由多个分辨率的图像(通过在指派区域周围嵌套一组随机视图构造)进行对齐。在推理期间,DynRefer 根据图像和任务先验条件,从嵌套视图中有选择地进行多模态指派,通过采样适当的区域表示来完成任务。这使得用于指派的视觉信息更好地匹配人类偏好,从而提高了区域级多模态模型的表示适应性。实验表明,DynRefer 在包括区域级描述生成、开放词汇区域识别和属性检测等广泛任务上均取得了互相提升的结果。此外,DynRefer 使用单个模型在多个区域级多模态任务上实现了最先进的结果。代码已公开 https://github.com/callsys/DynRefer。
引用
@article{arxiv.2405.16071,
title = {DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution},
author = {Yuzhong Zhao and Feng Liu and Yue Liu and Mingxiang Liao and Chen Gong and Qixiang Ye and Fang Wan},
journal= {arXiv preprint arXiv:2405.16071},
year = {2025}
}
备注
Accepted in CVPR 2025. Code is available at https://github.com/callsys/DynRefer