中文

面向视觉-语言数据集中的报告偏差:通过解耦物体-属性关联实现双模态增强

计算机视觉与模式识别 2023-10-03 v1

摘要

报告偏差指人们假定某些知识被普遍理解,从而认为无需显式阐述。本文关注视觉-语言数据集中广泛存在的报告偏差,其体现为物体-属性关联,并会进而降低在此类数据上训练的模型性能。为缓解该偏差,我们提出一种通过物体-属性解耦实现双模态增强(BiAug)的方法,以灵活合成具有丰富物体-属性配对组合的视觉-语言样本,并构建跨模态难负例。我们结合大语言模型(LLM)与接地物体检测器来提取目标物体;随后,LLM 为每个物体生成详尽属性描述,并产出相应的难负例对应样本;再利用修复模型基于这些详尽物体描述生成图像。如此,合成样本显式补充了被遗漏的物体与属性以供学习,难负例对则引导模型区分物体属性。实验表明 BiAug 在物体-属性理解上更优,且在 MSCOCO 与 Flickr30K 等通用基准的零样本检索任务上亦提升性能。BiAug 改进了文本-图像数据集的收集方式;缓解报告偏差有助于模型更深入理解视觉-语言现象,超越单纯频繁模式,涵盖真实场景的丰富性与多样性。

关键词

引用

@article{arxiv.2310.01330,
  title  = {Towards reporting bias in visual-language datasets: bimodal augmentation by decoupling object-attribute association},
  author = {Qiyu Wu and Mengjie Zhao and Yutong He and Lang Huang and Junya Ono and Hiromi Wakaki and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2310.01330},
  year   = {2023}
}