中文

CRAFT:一种用于视觉功能可供性 grounding 的神经符号框架

计算机视觉与模式识别 2025-07-22 v1

摘要

我们介绍 CRAFT,一种用于可解释可供性 grounding 的神经符号框架,用于识别场景中使给定动作(例如“cut”)可行的对象。CRAFT 将来自 ConceptNet 和语言模型的结构化常识先验与来自 CLIP 的视觉证据集成,通过能量基推理循环不断细化预测。该过程产生透明、以目标为导向的决策,以将符号和感知结构对齐。多对象、无标签的实验设置表明,CRAFT 在提高准确性的同时改进了可解释性,为实现稳健可信的场景理解提供了一步。

关键词

引用

@article{arxiv.2507.14426,
  title  = {CRAFT: A Neuro-Symbolic Framework for Visual Functional Affordance Grounding},
  author = {Zhou Chen and Joe Lin and Sathyanarayanan N. Aakur},
  journal= {arXiv preprint arXiv:2507.14426},
  year   = {2025}
}

备注

Accepted to NeSy 2025