中文

看见未定义的东西:面向生成语义标签的链式行动

计算机视觉与模式识别 2025-09-16 v2

摘要

近期视觉语言模型 (VLM) 的进展在利用预定义标签集合构建文本提示以实现零样本推理方面展现了惊人的图像分类能力。然而,这些方法在定义域未知且标签空间为组合性时面临显著局限。我们因此提出生成语义标签 (GSLs),这是一项旨在不受预定义标签集约束,为图像预测全面语义标签的新任务。不同于传统零样本分类,GSLs 生成多个语义层级的标签,涵盖对象、场景、属性和关系,从而为图像内容提供更丰富且更准确的表征。本文提出链式行动 (CoA),一种旨在解决GSLs任务的创新方法。CoA 基于观察到的丰富上下文信息在推理过程中显著提升生成性能而设计。具体而言,CoA 将GSLs任务分解为一序列详细行动。每一步行动提取并合并前一步的关键信息,将丰富的上下文传递给下一步,最终引导VLM生成全面且准确的语义标签。我们通过广泛的实验评估了CoA的有效性,结果在关键性能指标上均实现了显著提升,验证了CoA能够生成准确且上下文丰富的语义标签的能力。我们的工作不仅推动了生成语义标签的最新进展,也为将VLM应用于开放式和动态真实场景开辟了新方向。

关键词

引用

@article{arxiv.2411.17406,
  title  = {Seeing the Undefined: Chain-of-Action for Generative Semantic Labels},
  author = {Meng Wei and Zhongnian Li and Peng Ying and Xinzheng Xu},
  journal= {arXiv preprint arXiv:2411.17406},
  year   = {2025}
}

备注

15 pages, 8 figures