中文

D$^2$TV:面向多对多模态摘要的双重知识蒸馏与目标导向视觉建模

计算机视觉与模式识别 2023-10-17 v2 人工智能 计算与语言

摘要

多对多模态摘要(M3^3S)任务旨在以任意语言的文档输入及相应图像序列生成任意语言的摘要,其本质上包含单语模态摘要(MMS)与跨语言模态摘要(MXLS)任务。尽管近年大量工作致力于 MMS 或 MXLS 并获日益关注,鲜有研究关注 M3^3S 任务。此外,现有研究主要聚焦于 1) 利用 MMS 通过知识蒸馏增强 MXLS 而未考虑 MMS 性能,或 2) 通过隐式学习或显式复杂训练目标过滤与摘要无关的视觉特征以改进 MMS 模型。本文中,我们首先引入一个通用且实用的任务,即 M3^3S。进一步,我们提出一种用于 M3^3S 任务的双重知识蒸馏与目标导向视觉建模框架。具体而言,双重知识蒸馏方法保证 MMS 与 MXLS 的知识可相互迁移,从而相互促进二者。为提供目标导向的视觉特征,设计了一个简单而有效的目标导向对比目标,负责丢弃冗余视觉信息。多对多设定下的大量实验表明了所提方法的有效性。此外,我们将贡献一个多对多模态摘要(M3^3Sum)数据集。

关键词

引用

@article{arxiv.2305.12767,
  title  = {D$^2$TV: Dual Knowledge Distillation and Target-oriented Vision Modeling for Many-to-Many Multimodal Summarization},
  author = {Yunlong Liang and Fandong Meng and Jiaan Wang and Jinan Xu and Yufeng Chen and Jie Zhou},
  journal= {arXiv preprint arXiv:2305.12767},
  year   = {2023}
}

备注

EMNLP 2023 Findings