在视觉对话中扩展短语定位以涵盖代词
计算与语言
2022-10-25 v1 计算机视觉与模式识别
摘要
传统的短语定位旨在将给定描述中提到的名词短语定位至其对应图像区域,近来已取得巨大成功。显然,仅名词短语定位不足以支撑跨模态视觉语言理解。此处我们通过将代词亦纳入考虑来扩展该任务。首先,我们构建了一个包含名词短语与代词到图像区域的短语定位数据集。基于该数据集,我们使用此方向最先进的文献模型测试了短语定位性能。随后,我们利用共指信息增强基线定位模型,其应潜在有助于我们的任务,并通过图卷积网络对共指结构建模。在我们数据集上的实验有趣地显示,代词比名词短语更易定位,可能原因在于这些代词歧义性小得多。此外,我们引入共指信息的最终模型可显著提升名词短语与代词的定位性能。
引用
@article{arxiv.2210.12658,
title = {Extending Phrase Grounding with Pronouns in Visual Dialogues},
author = {Panzhong Lu and Xin Zhang and Meishan Zhang and Min Zhang},
journal= {arXiv preprint arXiv:2210.12658},
year = {2022}
}
备注
Accepted by EMNLP 2022