具有干净标注的 MSR-VTT 视频到文本数据集
计算机视觉与模式识别
2024-02-27 v4 机器学习
摘要
视频字幕生成可自动生成视频内容的简短描述,通常为单句形式。已有许多方法被提出以解决该任务。一个名为 MSR Video to Text(MSR-VTT)的大型数据集常被用作测试这些方法性能的基准数据集。然而,我们发现其中的人工标注(即数据集中视频内容的描述)噪声很大,例如存在许多重复字幕且许多字幕含有语法问题。这些问题可能给视频字幕模型学习潜在模式带来困难。我们通过消除这些问题清洗了 MSR-VTT 标注,随后在清洗后的数据集上测试了若干典型视频字幕模型。实验结果表明,数据清洗提升了以常用量化指标衡量的模型性能。我们招募受试者评估在原始与清洗数据集上训练的模型结果。人类行为实验表明,在清洗数据集上训练的模型生成的字幕与视频片段内容更连贯、更相关。
引用
@article{arxiv.2102.06448,
title = {The MSR-Video to Text Dataset with Clean Annotations},
author = {Haoran Chen and Jianmin Li and Simone Frintrop and Xiaolin Hu},
journal= {arXiv preprint arXiv:2102.06448},
year = {2024}
}
备注
The paper is under consideration at Computer Vision and Image Understanding