中文

PaCE:基于渐进式与组合式专家的统一多模态对话预训练

计算与语言 2023-06-14 v2 计算机视觉与模式识别

摘要

感知多模态信息并与人类完成对话是人工智能的长期目标。预训练通常被视为多模态对话的一种有效方法。然而,由于多模态对话数据的有限可用性,关于多模态对话预训练的研究仍然稀少。多模态对话的包罗万象性质带来了另一个引人关注的挑战,其涉及多种模态与任务。此外,新形式的任务可能在未来不可预测的时间点出现。因此,所设计的多模态对话模型必须具备足够的灵活性以适应此类场景。本文提出 PaCE,一个统一的、结构化的、组合式的多模态对话预训练框架。它利用若干基础专家的组合来适配多个对话相关任务,并可使用有限的对话数据与大量的非对话多模态数据进行预训练。此外,我们提出一种渐进式训练方法,其中过去的旧专家可协助新专家,促进其能力扩展。实验结果表明,PaCE 在八个多模态对话基准上取得了最先进的结果。

关键词

引用

@article{arxiv.2305.14839,
  title  = {PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts},
  author = {Yunshui Li and Binyuan Hui and ZhiChao Yin and Min Yang and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2305.14839},
  year   = {2023}
}

备注

ACL 2023