中文

字幕中隐藏了什么?数据集特定的语言多样性及其对视觉描述模型与指标的影响

计算机视觉与模式识别 2023-01-16 v2 计算与语言

摘要

尽管自动化视频描述领域已取得显著进展,但自动描述模型对新领域的泛化性能仍是将这些系统用于现实世界的主要障碍。众所周知,大多数视觉描述方法会捕捉并利用训练数据中的模式以提升评估指标,但这些模式究竟是什么?在本工作中,我们考察了几个流行的视觉描述数据集,捕捉、分析并理解了模型所利用但无法泛化到新领域的数据集特定语言模式。在词元级、样本级和数据集级,我们发现字幕多样性是生成通用且缺乏信息量的字幕的主要驱动因素。我们进一步表明,最先进的模型在现代指标上甚至优于留出的真实标注字幕,且这一效应是数据集中语言多样性的产物。理解这种语言多样性是构建强大字幕模型的关键,我们推荐了若干在收集新数据时保持多样性、以及在使用当前模型与指标时应对有限多样性后果的方法与途径。

关键词

引用

@article{arxiv.2205.06253,
  title  = {What's in a Caption? Dataset-Specific Linguistic Diversity and Its Effect on Visual Description Models and Metrics},
  author = {David M. Chan and Austin Myers and Sudheendra Vijayanarasimhan and David A. Ross and Bryan Seybold and John F. Canny},
  journal= {arXiv preprint arXiv:2205.06253},
  year   = {2023}
}

备注

The 1st Workshop on Vision Datasets Understanding, IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR), 2022