输入在自然语言视频描述中的作用
计算机视觉与模式识别
2021-02-11 v1 计算与语言
多媒体
摘要
自然语言视频描述(NLVD)近来在计算机视觉、自然语言处理(NLP)、多媒体和自主机器人领域受到强烈关注。最先进(SotA)的方法在基准数据集上测试时取得了显著结果。然而,这些方法对新数据集的泛化能力较差。此外,现有工作均未关注 NLVD 系统输入的处理,而该输入同时包含视觉与文本信息。本工作提出了一项关于视觉输入作用、并针对整体 NLP 性能进行评估的广泛研究。这是通过对视觉分量进行数据增强来实现的,即施加常见的变换以模拟真实操作场景中典型的相机畸变、噪声、光照和相机位姿。我们提出了一种基于 t-SNE 的分析来评估所考虑变换对整体视觉数据分布的影响。本研究采用了微软研究院视频描述(MSVD)数据集的英文子集,该子集常用于 NLVD。我们观察到该数据集包含相当数量的句法与语义错误。这些错误已被手动修正,修正后的新版本数据集(称为 MSVD-v2)用于实验中。我们发布了 MSVD-v2 数据集,以帮助深入理解 NLVD 问题。
引用
@article{arxiv.2102.05067,
title = {The Role of the Input in Natural Language Video Description},
author = {Silvia Cascianelli and Gabriele Costante and Alessandro Devo and Thomas A. Ciarfuglia and Paolo Valigi and Mario L. Fravolini},
journal= {arXiv preprint arXiv:2102.05067},
year = {2021}
}
备注
In IEEE Transactions on Multimedia