通过视觉与语言的低维属性对齐实现灵活工具选择
计算机视觉与模式识别
2025-08-22 v4 人工智能
计算与语言
神经元与认知
摘要
灵活的工具选择反映了人类区别于其他物种的复杂认知能力,然而捕捉这种能力的计算模型仍不成熟。我们开发了一个框架,利用低维属性表示来桥接视觉工具感知与语言任务理解。我们构建了一个综合数据集 (ToolNet),包含 115 种常见工具,标注了 13 种精心设计的属性,涵盖物理、功能和心理特性,并配以描述工具使用场景的自然语言。视觉编码器 (ResNet 或 ViT) 从工具图像中提取属性,而微调过的语言模型 (GPT-2, LLaMA, DeepSeek) 从任务描述中推导所需属性。我们的方法在工具选择任务中达到了 74% 的准确率——显著优于直接工具匹配 (20%) 和较小的多模态模型 (21%-58%),同时以极少的参数量逼近了 GPT-4o 等大型模型的性能 (73%)。人类评估研究验证了我们的框架与人类决策模式的一致性,泛化实验证明了其在新型工具类别上的有效性能。消融研究表明,与操作相关的属性(可抓取性、延展性、手部相关性)在各模态中始终最为关键。这项工作提供了一种参数高效且可解释的解决方案,模拟了类人的工具认知,推动了认知科学理解及工具选择任务的实际应用。
引用
@article{arxiv.2505.22146,
title = {Flexible Tool Selection through Low-dimensional Attribute Alignment of Vision and Language},
author = {Guangfu Hao and Haojie Wen and Liangxuan Guo and Yang Chen and Yanchao Bi and Shan Yu},
journal= {arXiv preprint arXiv:2505.22146},
year = {2025}
}