中文

聚焦解码与训练对象:基于特定目标引导去噪与视觉语言顾问的SOV解码

计算机视觉与模式识别 2024-12-24 v3

摘要

近期基于Transformer的方法通过利用DETR的检测与视觉语言模型(VLM)的先验知识,在人体-物体交互检测(HOID)任务上取得了显著进展。然而,这些方法在解码过程中因物体检测与HOI识别纠缠而导致训练时间延长且优化复杂。特别是,用于同时预测标签与边界框的查询嵌入存在表示模糊的问题,且HOI标签与动词标签预测之间的差距未被考虑。为应对这些挑战,我们提出SOV-STG-VLA,包含三个关键组件:主体-物体-动词(SOV)解码、特定目标引导(STG)去噪以及视觉语言顾问(VLA)。我们的SOV解码器通过新颖的交互区域表示解耦物体检测与动词识别。STG去噪策略利用真值信息学习标签嵌入以引导训练与推理。我们的SOV-STG实现了快速收敛与高精度,并为VLA融合VLM先验知识奠定基础。我们引入视觉顾问解码器以融合交互区域信息与VLM的视觉知识,以及动词-HOI预测桥以促进交互表示学习。我们的VLA显著提升了SOV-STG,并以仅相当于近期SOTA六分之一的训练轮数达到SOTA性能。代码与模型见https://github.com/cjw2021/SOV-STG-VLA

关键词

引用

@article{arxiv.2307.02291,
  title  = {Focusing on what to decode and what to train: SOV Decoding with Specific Target Guided DeNoising and Vision Language Advisor},
  author = {Junwen Chen and Yingcheng Wang and Keiji Yanai},
  journal= {arXiv preprint arXiv:2307.02291},
  year   = {2024}
}