中文

ContextQFormer:一种面向多轮多模态对话的上下文建模新方法

计算与语言 2025-07-18 v2 人工智能

摘要

多模态大语言模型展现了出色的零样本能力和强大的图像理解能力。然而,现有的开源多模态模型在多轮交互能力方面表现较弱,尤其是在长上下文场景下。为了解决这一问题,我们首先引入了一个上下文建模模块,称为 ContextQFormer,它利用一个记忆块来增强上下文信息的表示。此外,为了促进进一步的研究,我们精心构建了一个新的多轮多模态对话数据集(TMDialog),用于预训练、指令微调和评估,该数据集将于近期开源。与其他多模态对话数据集相比,TMDialog 包含更长的对话,从而支持多轮多模态对话的研究。此外,在 TMDialog 上将 ContextQFormer 与三个基线进行了比较,实验结果表明,ContextQFormer 的可用率比基线提高了 2%-4%。

关键词

引用

@article{arxiv.2505.23121,
  title  = {ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations},
  author = {Yiming Lei and Zhizheng Yang and Zeming Liu and Haitao Leng and Shaoguo Liu and Tingting Gao and Qingjie Liu and Yunhong Wang},
  journal= {arXiv preprint arXiv:2505.23121},
  year   = {2025}
}

备注

9 pages, 6 figures