TEXT2AFFORD:仅从文本探测语言模型的对象可供性预测能力
计算与语言
2025-09-29 v3
摘要
我们研究了预训练语言模型(LMs)和预训练视觉 - 语言模型(VLMs)中关于对象可供性(object affordances)的知识。越来越多的文献表明,预训练语言模型(PTLMs)会以不一致且非直观的方式失败,显示出推理和 grounding 能力的缺乏。为了迈出量化 grounding 效应(或其缺失)的第一步,我们构建了一个新颖且全面的对象可供性数据集——Text2Afford,该数据集包含 15 个可供性类别。与在视觉和语言领域收集的可供性数据集不同,我们对自然场景下的句子进行了对象和可供性标注。实验结果表明,PTLMs 在处理不常见的对象可供性时表现出有限的推理能力。我们还观察到,预训练 VLMs 未必能有效捕捉对象可供性。通过少样本微调,我们展示了 PTLMs 和 VLMs 在可供性知识上的提升。我们的研究为语言 grounding 任务贡献了一个新颖的数据集,并提供了关于 LM 能力的见解,推进了对对象可供性的理解。代码和数据可在 https://github.com/sayantan11995/Text2Afford 获取。
引用
@article{arxiv.2402.12881,
title = {TEXT2AFFORD: Probing Object Affordance Prediction abilities of Language Models solely from Text},
author = {Sayantan Adak and Daivik Agrawal and Animesh Mukherjee and Somak Aditya},
journal= {arXiv preprint arXiv:2402.12881},
year = {2025}
}
备注
Accepted at Conference on Computational Natural Language Learning 2024