基于群组与记忆注意力的区分性图像描述生成
计算机视觉与模式识别
2022-04-11 v4 计算与语言
机器学习
摘要
使用自然语言描述图像被广泛称为图像描述生成(image captioning),随着计算机视觉与自然语言生成技术的发展,该任务已取得持续进展。尽管传统描述模型基于 BLEU、CIDEr 和 SPICE 等常用指标达到了较高准确率,但描述区分目标图像与其他相似图像的能力仍未被充分探索。为生成区分性描述,少数先驱采用对比学习或重新加权真实描述,其关注点仅在于单张输入图像。然而,相似图像群组(例如同一相册中的物品或属性,或细粒度事件)中物体间的关系被忽视了。本文中,我们提出基于群组的区分性描述模型(GdisCap)来提升图像描述的区分性,该模型将每张图像与同一相似群组中的其他图像进行比较,并突出每张图像的独特性。具体而言,我们提出基于群组的记忆注意力(GMA)模块,其存储在该图像群组中具有唯一性的物体特征(即与其他图像中物体相似度低的特征)。这些独特物体特征在生成描述时被突出,从而产生更具区分性的描述。此外,真实描述中的区分性词语被筛选出来以监督语言解码器与 GMA。最后,我们提出一种新的评价指标——区分词率(DisWordRate)来衡量描述的区分性。定量结果表明,所提方法显著提升了多个基线模型的区分性,并在准确率与区分性上均达到最先进(state-of-the-art)性能。用户研究结果与定量评估一致,并证明了新指标 DisWordRate 的合理性。
引用
@article{arxiv.2108.09151,
title = {Group-based Distinctive Image Captioning with Memory Attention},
author = {Jiuniu Wang and Wenjia Xu and Qingzhong Wang and Antoni B. Chan},
journal= {arXiv preprint arXiv:2108.09151},
year = {2022}
}
备注
Accepted at ACM MM 2021 (oral)