中文

在情境猜物游戏中从感知信息想象具身概念表示

计算与语言 2020-11-06 v1 计算机视觉与模式识别 机器学习

摘要

在视觉猜物游戏中,猜测者须通过向先知提问来识别场景中的目标物体。玩家的一种有效策略是学习既具判别性又具足够表达力以正确提问与猜测的物体概念表示。然而,正如 Suglia 等人(2020)所示,现有模型未能学习真正的多模态表示,而是在训练与推理时都依赖场景中物体的金类标。当推理时类别与训练时类别匹配时,这提供了不自然的性能优势;并且在涉及域外物体类别的更现实“零样本”场景中导致模型失败。为克服此问题,我们引入一种基于正则化自编码器的新型“想象”模块,该模块在推理时不依赖类别标签即可学习上下文感知与类别感知的潜在嵌入。我们的想象模块在 CompGuessWhat?! 零样本场景(Suglia 等人,2020)中以 8.26% 的游戏准确率超越最先进竞争对手,并且在 GuessWhat?! 基准中当推理时无金类别可用时,将先知与猜测者的准确率分别提升 2.08% 与 12.86%。该想象模块还增强了对物体属性与特征的推理。

关键词

引用

@article{arxiv.2011.02917,
  title  = {Imagining Grounded Conceptual Representations from Perceptual Information in Situated Guessing Games},
  author = {Alessandro Suglia and Antonio Vergari and Ioannis Konstas and Yonatan Bisk and Emanuele Bastianelli and Andrea Vanzo and Oliver Lemon},
  journal= {arXiv preprint arXiv:2011.02917},
  year   = {2020}
}

备注

Accepted to the International Conference on Computational Linguistics (COLING) 2020