用于描述日语中人类动作的视频字幕数据集
计算与语言
2020-03-11 v1 计算机视觉与模式识别
摘要
近年来,自动视频字幕生成引起了相当多的关注。本文聚焦于生成描述人类动作的日语字幕。虽然当前大多数可用的视频字幕数据集是为英语构建的,但尚无对应的日语数据集。为此,我们构建了一个大规模的日语视频字幕数据集,包含79,822个视频与399,233条字幕。我们数据集中每条字幕以“谁在何处做什么”的形式描述一个视频。描述人类动作时,识别人物、地点与动作的细节十分重要。事实上,当我们描述人类动作时,通常会提及场景、人物与动作。在我们的实验中,我们评估了两种字幕生成方法以获得基准结果。此外,我们探究了这些生成方法能否指定“谁在何处做什么”。
引用
@article{arxiv.2003.04865,
title = {Video Caption Dataset for Describing Human Actions in Japanese},
author = {Yutaro Shigeto and Yuya Yoshikawa and Jiaqing Lin and Akikazu Takeuchi},
journal= {arXiv preprint arXiv:2003.04865},
year = {2020}
}
备注
Accepted for LREC 2020. Dataset available at https://actions.stair.center/captions.html