中文

视觉指代表达生成中场景上下文带来的韧性

计算与语言 2024-08-26 v2

摘要

场景上下文已知有助于人类感知可见物体。在本文中,我们研究了上下文在图像中物体的指代表达生成(REG)中的作用,现有研究通常关注对生成器施加压力的干扰上下文。我们对REG中的场景上下文采取了一种新视角,假设上下文信息可以被视为一种资源,使REG模型更具韧性,并促进物体描述(尤其是物体类型)的生成。我们训练并测试了基于Transformer的REG模型,其目标表示被人为地用噪声不同程度地遮蔽。我们评估了模型视觉上下文的属性如何影响其处理和性能。我们的结果表明,即使是简单的场景上下文也能使模型对扰动具有惊人的韧性,以至于即使关于目标的视觉信息完全缺失,它们也能识别指代类型。

关键词

引用

@article{arxiv.2404.12289,
  title  = {Resilience through Scene Context in Visual Referring Expression Generation},
  author = {Simeon Junker and Sina Zarrieß},
  journal= {arXiv preprint arXiv:2404.12289},
  year   = {2024}
}