L2C:描述视觉差异需要对个体进行语义理解
计算机视觉与模式识别
2021-02-04 v1 计算与语言
摘要
语言与视觉领域的近期进展推动了从为单张图像生成描述到描述图像对之间视觉差异的研究。假设有两张图像 I_1 和 I_2,任务是生成比较它们的描述 W_{1,2},现有方法直接建模 { I_1, I_2 } -> W_{1,2} 的映射,而缺乏对个体的语义理解。本文提出一种学习比较(Learning-to-Compare, L2C)模型,该模型在学习描述每张图像的同时,学习理解这两张图像的语义结构并对其进行对比。我们证明,L2C 得益于显式语义表示与单图像描述之间的比较,并在新的测试图像对上具有更好的泛化能力。在 Birds-to-Words 数据集上,它在自动评测和人工评测方面均优于基线方法。
引用
@article{arxiv.2102.01860,
title = {L2C: Describing Visual Differences Needs Semantic Understanding of Individuals},
author = {An Yan and Xin Eric Wang and Tsu-Jui Fu and William Yang Wang},
journal= {arXiv preprint arXiv:2102.01860},
year = {2021}
}
备注
EACL-2021 short