中文

基于动词嵌入的动态关系推断

计算与语言 2025-09-17 v2 计算机视觉与模式识别

摘要

CLIP 通过对比学习任务的训练,展示了卓越的图像-文本匹配能力。然而,已有研究表明,CLIP 在匹配依赖于表示图像中对象之间关系时(即推断关系)方面表现不佳。此前尝试仅通过语言监督在关系检测数据集上训练 CLIP 以克服此限制的尝试效果有限。本文提供了见解和实用方法,以推动关系推断领域的发展。本文的方法是通过生成文本和图像嵌入来捕捉关系,从而有效检测图像中对象之间的关系。为此,我们提出了通过动词嵌入实现动态关系推断(DRIVE)方法,该方法扩充了 COCO 数据集,使用困难的主语-关系-宾语三元组及其对应图像对 CLIP 进行微调,并引入新型损失函数以提高关系检测性能。在多个 CLIP 基础模型上进行的评估表明,我们的方法在冻结和微调设置下的零样本关系推断准确率均显著提高,显著优于 CLIP 和最先进的模型,同时在 unseen 数据上也表现出良好的泛化能力。

关键词

引用

@article{arxiv.2503.13021,
  title  = {Dynamic Relation Inference via Verb Embeddings},
  author = {Omri Suissa and Muhiim Ali and Ariana Azarbal and Hui Shen and Shekhar Pradhan},
  journal= {arXiv preprint arXiv:2503.13021},
  year   = {2025}
}