中文

ART:自适应关系调谐用于通用关系预测

计算机视觉与模式识别 2025-08-11 v2 人工智能

摘要

视觉关系检测(VRD)是识别场景中对象之间关系的任务。仅基于关系检测数据训练的 VRD 模型难以泛化到训练时未出现的关系。虽然 prompt tuning 已用于适配视觉语言模型(VLM)以进行 VRD,但采用手工 prompt 且难以处理新型或复杂关系。我们认为,指令微调是更有效的解决方案,通过对 VLMs 进行指令数据微调来实现适配。因此,我们引入 ART(Adaptive Relation Tuning)框架,通过指令微调和战略实例选择来适配 VLMs 以完成 VRD。将 VRD 数据集转换为指令微调格式,并采用自适应抽样算法,引导 VLM 聚焦于信息丰富的关系,同时保持泛化能力。具体而言,我们关注关系分类,即给定主体-客体边界框,模型预测其之间的谓词。我们在保留训练集上进行微调,在多个复杂度不同的保留测试集上进行评估。我们的方法显著优于基线方法,并能推断出主流 VRD 方法所缺乏的未见关系概念。我们展示了 ART 在实际中的价值,通过预测的关系对复杂场景进行分割。

关键词

引用

@article{arxiv.2507.23543,
  title  = {ART: Adaptive Relation Tuning for Generalized Relation Prediction},
  author = {Gopika Sudhakaran and Hikaru Shindo and Patrick Schramowski and Simone Schaub-Meyer and Kristian Kersting and Stefan Roth},
  journal= {arXiv preprint arXiv:2507.23543},
  year   = {2025}
}

备注

Accepted for publication in ICCV 2025