从情绪视角审视视频段落描述生成
计算机视觉与模式识别
2022-03-15 v1
摘要
将视觉数据转化为自然语言对于机器理解世界并与人类交互至关重要。本工作中,我们对视频段落描述生成进行了综合研究,旨在为给定视频生成段落级描述。然而,当前研究主要关注检测客观事实,忽视了建立句子间逻辑关联以及发现与视频内容更精确情绪的需求。该问题损害了预测描述的流畅与丰富表达,远未达到人类语言标准。为解决此问题,我们提出为该任务构建大规模情绪与逻辑驱动的多语言数据集。该数据集命名为EMVPC(意为“Emotional Video Paragraph Captioning”),包含日常生活中53种广泛使用情绪、对应这些情绪的376种常见场景、10,291个高质量视频以及20,582条精心撰写的含中英版本的段落描述。该新数据集还提供了相关的情绪类别、场景标签、情绪词标签与逻辑词标签。所提出的EMVPC数据集旨在从丰富情绪、连贯逻辑与精细表达方面提供完备的视频段落描述,也可惠及视觉-语言领域的其他任务。此外,通过在已有基准视频段落描述数据集与所提EMVPC上的实验开展了综合研究。将来自不同视觉描述任务的SOTA方案依据15种流行度量进行比较,并总结了其详细的客观与主观结果。最后,还讨论了视频段落描述生成的遗留问题与未来方向。本工作的独特视角有望推动视频段落描述生成研究的进一步发展。
引用
@article{arxiv.2203.06356,
title = {Taking an Emotional Look at Video Paragraph Captioning},
author = {Qinyu Li and Tengpeng Li and Hanli Wang and Chang Wen Chen},
journal= {arXiv preprint arXiv:2203.06356},
year = {2022}
}