中文

面向多模态对话理解与生成的场景感知提示

计算与语言 2022-07-06 v1 计算机视觉与模式识别

摘要

本文介绍了灵境团队在NLPCC-2022共享任务4多模态对话理解与生成(MDUG)中的实验方案。MDUG任务可分为两个阶段:多模态上下文理解与回复生成。为充分利用视觉信息进行场景理解与对话生成,我们针对MDUG任务提出了场景感知提示。具体而言,我们采用多任务策略联合建模场景与会话的多模态理解。采用视觉描述文本以感知场景信息,而基于场景与会话感知标签的固定类型模板化提示则用于进一步提升对话生成性能。大量实验结果表明,所提方法相较于其他竞争方法取得了最先进(SOTA)性能,我们在该MDUG竞赛的三个子任务中均排名第1。

关键词

引用

@article{arxiv.2207.01823,
  title  = {Scene-Aware Prompt for Multi-modal Dialogue Understanding and Generation},
  author = {Bin Li and Yixuan Weng and Ziyu Ma and Bin Sun and Shutao Li},
  journal= {arXiv preprint arXiv:2207.01823},
  year   = {2022}
}

备注

Accepted in NLPCC 2022