TROPE:无训练对象部件增强以无缝提升细粒度零样本图像字幕
计算机视觉与模式识别
2024-11-05 v2 计算与语言
摘要
零样本推理即指在没有特定训练数据的情况下进行的任务,大型模型如 CLIP 的一个激动人心的新能力。虽然已有大量研究探索了增强 CLIP 等模型在图像字幕任务上的零样本能力,但这些方法在细粒度数据集(如 CUB、FLO、UCM-Captions、Sydney-Captions)上表现不足。这些数据集需要字幕能够区分视觉和语义上相似的类别,关注对象细部及其属性。为克服这一挑战,我们提出 TRaining-Free Object-Part Enhancement (TROPE)。TROPE 通过目标检测提案和自然语言处理技术丰富基字幕中的对象部件细节。它补充而不改变基字幕,实现无缝集成,为用户提供更大的灵活性。我们的评估显示,TROPE 在所有测试的零样本 IC 方法上均实现了性能提升,并在细粒度 IC 数据集上实现了最先进的效果。
引用
@article{arxiv.2409.19960,
title = {TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning},
author = {Joshua Feinglass and Yezhou Yang},
journal= {arXiv preprint arXiv:2409.19960},
year = {2024}
}
备注
Accepted to EMNLP 2024 Findings