TextRegion:从冻结的图文模型中提取文本对齐的区域词符
计算机视觉与模式识别
2025-11-07 v2
摘要
图文模型在图像级任务中表现出色,但在精细的视觉理解方面存在困难。虽然这些模型提供了强大的视觉-语言对齐,但像 SAM2 这样的分割模型为对象提供了精确的空间边界。为此,我们提出 TextRegion,这是一个简单、有效且无需训练的框架,结合了图文模型和 SAM2 的优势,以生成强大的文本对齐区域词符。这些词符在保留开放词汇能力的同时,实现了精细的视觉理解。它们可以直接应用于各种下游任务,包括开放世界语义分割、指代表达理解和接地。我们进行了广泛的评估,与最先进的无训练方法相比,持续取得优越或具竞争力的性能。此外,我们的框架与许多图文模型兼容,使其随着更强的模型出现而具有高度实用性和易于扩展的特性。代码获取地址:https://github.com/avaxiao/TextRegion。
引用
@article{arxiv.2505.23769,
title = {TextRegion: Text-Aligned Region Tokens from Frozen Image-Text Models},
author = {Yao Xiao and Qiqian Fu and Heyi Tao and Yuqun Wu and Zhen Zhu and Derek Hoiem},
journal= {arXiv preprint arXiv:2505.23769},
year = {2025}
}
备注
Published in TMLR, with a J2C Certification