用于校准跨模态检索的关系对齐学习
计算与语言
2021-06-08 v2 计算机视觉与模式识别
信息检索
摘要
尽管大规模多模态预训练方法取得了诸多成就,跨模态检索(如图像-文本检索)仍是一项具有挑战性的任务。为弥合两种模态间的语义鸿沟,以往研究主要聚焦于物体层面的词-区域对齐,缺乏词间语言关系与区域间视觉关系之间的匹配。对此种关系一致性的忽视损害了图像-文本对的上下文化表示,并阻碍了模型性能与可解释性。本文中,我们首先提出一种新度量——模态内自注意力距离(Intra-modal Self-attention Distance, ISD),通过度量语言关系与视觉关系间的语义距离来量化关系一致性。对此,我们提出模态内自注意力上的跨模态对齐(Inter-modal Alignment on Intra-modal Self-attentions, IAIS),一种正则化训练方法,以优化 ISD 并通过跨模态对齐相互校准来自两个模态的模态内自注意力。IAIS 正则化项在 Flickr30k 与 MS COCO 数据集上以可观幅度提升了主流模型的性能,证明了我们方法的优越性。
引用
@article{arxiv.2105.13868,
title = {Learning Relation Alignment for Calibrated Cross-modal Retrieval},
author = {Shuhuai Ren and Junyang Lin and Guangxiang Zhao and Rui Men and An Yang and Jingren Zhou and Xu Sun and Hongxia Yang},
journal= {arXiv preprint arXiv:2105.13868},
year = {2021}
}
备注
Accepted by ACL-IJCNLP 2021 main conference (Long Paper)