中文

基于组的区分性图像描述:记忆差异编码与注意力机制

计算机视觉与模式识别 2025-04-04 v1 多媒体

摘要

图像描述的最新进展集中在通过大幅增加数据集和模型规模来提高准确性。虽然传统描述模型在 BLEU、CIDEr 和 SPICE 等既定指标上表现优异,但描述区分目标图像与其他相似图像的能力尚未得到充分探索。为了生成具有区分性的描述,少数先驱采用了对比学习或对真实描述进行重新加权。然而,这些方法往往忽略了相似图像组中对象之间的关系(例如,同一相册中的项目或属性,或细粒度事件)。本文提出了一种增强图像描述区分性的新方法,即基于组的差异区分性描述方法,该方法将每张图像与相似组中的其他图像进行视觉比较,并突出每张图像的独特性。具体而言,我们引入了一个基于组的差异记忆注意力(GDMA)模块,旨在识别并强调图像中在其图像组内具有独特区分性的对象特征,即那些与其他图像中对象相似度较低的特征。该机制确保在生成该图像的描述时优先考虑这些独特的对象特征,从而增强最终描述的区分性。为了进一步优化这一过程,我们从真实描述中选择区分性词语来指导语言解码器和 GDMA 模块。此外,我们提出了一种新的评估指标——区分性词率(DisWordRate),用于定量评估描述的区分性。定量结果表明,所提方法显著提高了多个基线模型的区分性,并在区分性方面达到了最先进的性能,同时没有过度牺牲准确性……

关键词

引用

@article{arxiv.2504.02496,
  title  = {Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention},
  author = {Jiuniu Wang and Wenjia Xu and Qingzhong Wang and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2504.02496},
  year   = {2025}
}

备注

20 pages. arXiv admin note: substantial text overlap with arXiv:2108.09151