你为何出错?面向三维物体语言接地的反事实解释
人工智能
2025-05-12 v1 计算机视觉与模式识别
机器学习
摘要
将自然语言与几何形状相结合是一个新兴的研究领域,在机器人技术和语言辅助设计中有多种应用。该领域的一个关键任务是物体指称识别,即根据目标的文本描述选择三维物体。语言描述的可变性和三维物体的空间关系使得这项任务变得复杂,从而增加了更好地理解该领域神经网络模型行为的需求。然而,这方面的研究有限。具体来说,当模型在提供了看似正确的物体描述后仍做出错误预测时,从业者会疑惑:“模型为什么会出错?”。在这项工作中,我们提出了一种通过生成反事实示例来回答这个问题的方法。我们的方法接收一个包含两个物体和一个文本描述的错误分类样本,并生成一个替代但相似的表述,该表述本应使模型做出正确预测。我们使用 ShapeTalk 数据集的数据以及三个不同的模型评估了我们的方法。我们生成的反事实示例保持了原始描述的结构,语义相似且有意义。它们揭示了描述中的弱点、模型偏差,并增强了对模型行为的理解。这些见解有助于从业者更好地与系统交互,并帮助工程师改进模型。
引用
@article{arxiv.2505.06030,
title = {Why Are You Wrong? Counterfactual Explanations for Language Grounding with 3D Objects},
author = {Tobias Preintner and Weixuan Yuan and Qi Huang and Adrian König and Thomas Bäck and Elena Raponi and Niki van Stein},
journal= {arXiv preprint arXiv:2505.06030},
year = {2025}
}
备注
Accepted at IJCNN 2025