中文

基于因果干预的依赖多任务学习用于图像描述生成

机器学习 2021-05-19 v1 计算机视觉与模式识别 图像与视频处理

摘要

近期图像描述生成工作主要遵循先提取后生成的范式,预提取一系列基于对象的特征序列,然后将图像描述生成视为单一序列到序列任务。尽管有前景,我们观察到生成描述中的两个问题:1)内容不一致,模型会生成相互矛盾的事实;2)信息量不足,模型会遗漏部分重要信息。从因果视角看,原因是模型捕获了视觉特征与某些表达之间的虚假统计相关性(例如“长发”和“女人”的视觉特征)。本文提出一种带因果干预的依赖多任务学习框架(DMTCI)。首先,我们在最终任务图像描述生成之前引入一个中间任务——类别词袋生成。该中间任务有助于模型更好地理解视觉特征,从而缓解内容不一致问题。其次,我们在模型上应用Pearl的do演算,切断视觉特征与可能混杂因素之间的联系,从而使模型聚焦于因果视觉特征。具体而言,高频概念集被视为代理混杂因素,真实混杂因素在连续空间中推断。最后,我们使用多智能体强化学习(MARL)策略实现端到端训练并减少任务间误差累积。大量实验表明,我们的模型优于基线模型,并与最先进模型取得有竞争力的性能。

关键词

引用

@article{arxiv.2105.08573,
  title  = {Dependent Multi-Task Learning with Causal Intervention for Image Captioning},
  author = {Wenqing Chen and Jidong Tian and Caoyun Fan and Hao He and Yaohui Jin},
  journal= {arXiv preprint arXiv:2105.08573},
  year   = {2021}
}

备注

To be published in IJCAI 2021