中文

ECIS-VQG:从视频生成以实体为中心的信息寻求型问题

计算机视觉与模式识别 2024-10-15 v1 计算与语言

摘要

以往关于视频问题生成的研究大多集中于生成关于常见物体和属性的问题,因此并非以实体为中心。在这项工作中,我们专注于从视频生成以实体为中心的信息寻求型问题。这样的系统可用于基于视频的学习、推荐“人们也问”问题、基于视频的聊天机器人以及事实核查。我们的工作解决了三个关键挑战:识别值得提问的信息、将其与实体关联,以及有效利用多模态信号。此外,据我们所知,目前尚不存在用于此任务的大规模数据集。大多数视频问题生成数据集都集中在电视节目、电影或人类活动上,或者缺乏以实体为中心的信息寻求型问题。因此,我们贡献了一个多样化的YouTube视频数据集VideoQuestions,包含411个视频和2265个手动标注的问题。我们进一步提出了一种模型架构,结合了Transformer、丰富的上下文信号(标题、转录文本、字幕、嵌入)以及交叉熵和对比损失的组合损失函数,以鼓励生成以实体为中心的问题。我们的最佳方法在BLEU、ROUGE、CIDEr和METEOR指标上分别达到了71.3、78.6、7.31和81.9分,证明了其实用性。我们将代码和数据集公开发布。https://github.com/thePhukan/ECIS-VQG

关键词

引用

@article{arxiv.2410.09776,
  title  = {ECIS-VQG: Generation of Entity-centric Information-seeking Questions from Videos},
  author = {Arpan Phukan and Manish Gupta and Asif Ekbal},
  journal= {arXiv preprint arXiv:2410.09776},
  year   = {2024}
}

备注

Accepted in EMNLP 2024, https://openreview.net/forum?id=CriKOn01dI