中文

语言模型作为零样本视频问答的因果知识提取器

计算与语言 2023-04-10 v1 计算机视觉与模式识别

摘要

因果视频问答(CVidQA)不仅查询视频中的关联或时间关系,还查询因果关系。现有的问题合成方法在阅读理解数据集上以文本描述作为输入预训练问题生成(QG)系统。然而,QG 模型仅学会提出关联问题(例如“某人在做什么……”),并因关联知识向关注“为什么某人在做……”这类因果问题的 CVidQA 迁移不佳而导致性能低下。观察到这一点,我们提出利用因果知识生成问答对,并提出了一种新颖框架——从语言模型提取因果知识(CaKE-LM),借助语言模型中的因果常识知识来解决 CVidQA。为从 LM 中提取知识,CaKE-LM 通过以动作(足球运动员踢球)提示 LM 来检索意图(为了进球),从而生成包含两个事件且一者触发另一者(例如“进球”触发“足球运动员踢球”)的因果问题。CaKE-LM 在 NExT-QA 和 Causal-VidQA 数据集上以零样本 CVidQA 准确率显著优于常规方法 4% 至 6%。我们还进行了全面分析并为未来研究提供了关键发现。

关键词

引用

@article{arxiv.2304.03754,
  title  = {Language Models are Causal Knowledge Extractors for Zero-shot Video Question Answering},
  author = {Hung-Ting Su and Yulei Niu and Xudong Lin and Winston H. Hsu and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2304.03754},
  year   = {2023}
}

备注

CVPR 2023 Workshop L3D-IVU