中文

用于描述日语中人类动作的视频字幕数据集

计算与语言 2020-03-11 v1 计算机视觉与模式识别

摘要

近年来,自动视频字幕生成引起了相当多的关注。本文聚焦于生成描述人类动作的日语字幕。虽然当前大多数可用的视频字幕数据集是为英语构建的,但尚无对应的日语数据集。为此,我们构建了一个大规模的日语视频字幕数据集,包含79,822个视频与399,233条字幕。我们数据集中每条字幕以“谁在何处做什么”的形式描述一个视频。描述人类动作时,识别人物、地点与动作的细节十分重要。事实上,当我们描述人类动作时,通常会提及场景、人物与动作。在我们的实验中,我们评估了两种字幕生成方法以获得基准结果。此外,我们探究了这些生成方法能否指定“谁在何处做什么”。

关键词

引用

@article{arxiv.2003.04865,
  title  = {Video Caption Dataset for Describing Human Actions in Japanese},
  author = {Yutaro Shigeto and Yuya Yoshikawa and Jiaqing Lin and Akikazu Takeuchi},
  journal= {arXiv preprint arXiv:2003.04865},
  year   = {2020}
}

备注

Accepted for LREC 2020. Dataset available at https://actions.stair.center/captions.html