视觉故事中实体的引入与指代
计算与语言
2019-09-24 v1 机器学习
机器学习
摘要
我们在日常生活中被视觉阐释的故事所包围。我们叙述故事的方式通常包括两个阶段:形成实体的中心心智图,然后围绕它们编织故事。连贯性的一个促成因素不仅在于基于这些实体构建故事,还在于使用恰当的术语指代它们以避免重复。在本文中,我们处理这两个阶段:在看似合理的节点引入正确实体,并在视觉叙事语境中连贯地指代它们。中心心智图的构建模块(也称为实体骨架)是包含名词与指代表达的实体链。该实体骨架也以不同抽象层级表示,以构成用于编织故事的泛化框架。我们基于编码器-解码器框架,在解码故事不遵循该实体骨架时对模型进行惩罚。我们建立了骨架知情生成的强基线,随后扩展其通过预测骨架与生成故事的多任务能力。最后,我们基于此模型提出一种全局-局部分层注意力模型,在句子(局部)和故事(全局)层级均关注骨架。我们观察到所提模型在自动评价指标 METEOR 上超越基线。我们进行了多种分析以评估强制实体骨架任务的性能,如生成实体的数量与多样性。我们还开展了人工评估,结论为我们的模型生成的视觉故事在 82% 的情况下更受偏好。此外,我们表明全局-局部分层注意力模型通过按名词出现需要引入更多代词而提升了连贯性。
引用
@article{arxiv.1909.09699,
title = {Induction and Reference of Entities in a Visual Story},
author = {Ruo-Ping Dong and Khyathi Raghavi Chandu and Alan W Black},
journal= {arXiv preprint arXiv:1909.09699},
year = {2019}
}
备注
9 pages, 4 figures, 3 tables