CRAFT:一种用于视觉功能可供性 grounding 的神经符号框架
计算机视觉与模式识别
2025-07-22 v1
摘要
我们介绍 CRAFT,一种用于可解释可供性 grounding 的神经符号框架,用于识别场景中使给定动作(例如“cut”)可行的对象。CRAFT 将来自 ConceptNet 和语言模型的结构化常识先验与来自 CLIP 的视觉证据集成,通过能量基推理循环不断细化预测。该过程产生透明、以目标为导向的决策,以将符号和感知结构对齐。多对象、无标签的实验设置表明,CRAFT 在提高准确性的同时改进了可解释性,为实现稳健可信的场景理解提供了一步。
引用
@article{arxiv.2507.14426,
title = {CRAFT: A Neuro-Symbolic Framework for Visual Functional Affordance Grounding},
author = {Zhou Chen and Joe Lin and Sathyanarayanan N. Aakur},
journal= {arXiv preprint arXiv:2507.14426},
year = {2025}
}
备注
Accepted to NeSy 2025