T-REN:学习文本对齐区域标记以提升密集视觉语言对齐与可扩展性
计算机视觉与模式识别
2026-04-21 v1
摘要
尽管近期取得了进展,但视觉语言编码器仍面临两个核心局限:(1) 语言与稠密视觉特征之间的对齐较弱,这会损害如开放词汇语义分割等任务;(2) 用于细粒度视觉表征的标记数量较大,这限制了对长视频的可扩展性。本文旨在解决这两个局限。我们提出了 T-REN(Text-aligned Region Encoder Network),一种高效编码器,将视觉数据映射到一组紧凑的文本对齐区域级别表征(或区域标记)。T-REN 通过在冻结的视觉主干网络上添加轻量级网络,训练以在每个语义区域内对补丁级别表征进行聚类,生成区域标记,并与区域级别文本注释对齐。该设计仅增加 3.7% 的额外参数,即可实现显著增强的稠密跨模态理解,同时将标记数量降低几个数量级。具体而言,T-REN 在 ADE20K 开放词汇分割上实现 +5.9 mIoU 提升,在 COCO 对象级文本图像检索中实现 +18.4% 检索率,在 Ego4D 视频目标定位中实现 +15.6% 检索率,在 VSPW 视频场景解析中实现 +17.6% mIoU 提升,同时将图像的标记数量降低超过 24 倍、视频的标记数量降低超过 187 倍,相较于基于补丁的视觉语言主干网络。代码和模型已提供于 https://github.com/savya08/T-REN。
引用
@article{arxiv.2604.18573,
title = {T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability},
author = {Savya Khosla and Sethuraman T and Aryan Chadha and Alex Schwing and Derek Hoiem},
journal= {arXiv preprint arXiv:2604.18573},
year = {2026}
}