中文

碎片化语言,整体化检测:语言基方法目标检测中的表征解耦与层次化聚合

计算机视觉与模式识别 2025-09-30 v1 人工智能

摘要

尽管视觉语言模型(VLM)在以简单语言查询进行多模态感知(例如开放词汇目标检测)方面取得了显著进展,但最新的VLM仍显示出在涉及描述性属性和关系从句的复杂查询方面的能力受限。我们的深入分析表明,这些限制主要源于VLM中的文本编码器。这些文本编码器类似于词袋模型,无法在复杂查询中区分目标对象与其描述性属性和关系,导致频繁的误报。为此,我们提出了根据句子中的层次关系对语言表征进行重构,以适用于语言基方法的目标检测。关键洞察是,将文本标记解耦为核心组件——对象、属性和关系(“talk in pieces”)——并随后聚合为层次化的句子级表征(“see in whole”)。基于此原则,我们引入了TaSe框架,包含三个主要贡献:(1)一个覆盖从类别名称到描述性句子三个层级的层次化合成标注数据集;(2)Talk in Pieces,即由新颖的解耦损失函数指导的三组件解耦模块,将文本嵌入转换为子空间组成;(3)See in Whole,通过所提出的层次化目标引导,将解耦组件学习为层次化结构的嵌入。该TaSe框架强化了层次化语言结构的归纳偏置,为语言基方法的目标检测生成细粒度的多模态表征。实验结果在OmniLabel基准测试中显示出24%的性能提升,证明了语言组成性的重要性。

关键词

引用

@article{arxiv.2509.24192,
  title  = {Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection},
  author = {Sojung An and Kwanyong Park and Yong Jae Lee and Donghyun Kim},
  journal= {arXiv preprint arXiv:2509.24192},
  year   = {2025}
}

备注

23 pages, 17 figures