中文

Planner-Refiner:用于视频视觉语言对齐的动态时空细化

计算机视觉与模式识别 2025-08-19 v2

摘要

视频视觉语言对齐必须解决语言复杂性、交互实体的演变、它们的行动链以及语言与视觉之间的语义差距这一问题。本工作引入Planner-Refiner框架来克服这些挑战。Planner-Refiner通过迭代细化视觉元素时空表征,引导语言直至语义差距最小化。Planner模块通过分解复杂语言提示为短句链来调度语言指导。Refiner处理每个短句(名词短语和动词短语配对),以引导视觉标记在空间上再时间上的自注意力,实现高效的单步细化。循环系统链式连接这些步骤,保持细化后的视觉标记表征。最终表征输入到任务特定的头部用于对齐生成。我们在两个视频语言对齐任务上展示了Planner-Refiner的有效性:指代视频对象分割和时间锚定,语言复杂度各不相同。我们进一步引入新的MeViS-X基准测试以评估模型处理长查询的能力。与最先进的方法在这些基准测试上的优异性能显示了该方法的潜力,尤其适用于复杂提示。

关键词

引用

@article{arxiv.2508.07330,
  title  = {Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos},
  author = {Tuyen Tran and Thao Minh Le and Quang-Hung Le and Truyen Tran},
  journal= {arXiv preprint arXiv:2508.07330},
  year   = {2025}
}

备注

Accepted for publication at ECAI 2025