ContextQFormer:一种面向多轮多模态对话的上下文建模新方法
计算与语言
2025-07-18 v2 人工智能
摘要
多模态大语言模型展现了出色的零样本能力和强大的图像理解能力。然而,现有的开源多模态模型在多轮交互能力方面表现较弱,尤其是在长上下文场景下。为了解决这一问题,我们首先引入了一个上下文建模模块,称为 ContextQFormer,它利用一个记忆块来增强上下文信息的表示。此外,为了促进进一步的研究,我们精心构建了一个新的多轮多模态对话数据集(TMDialog),用于预训练、指令微调和评估,该数据集将于近期开源。与其他多模态对话数据集相比,TMDialog 包含更长的对话,从而支持多轮多模态对话的研究。此外,在 TMDialog 上将 ContextQFormer 与三个基线进行了比较,实验结果表明,ContextQFormer 的可用率比基线提高了 2%-4%。
引用
@article{arxiv.2505.23121,
title = {ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations},
author = {Yiming Lei and Zhizheng Yang and Zeming Liu and Haitao Leng and Shaoguo Liu and Tingting Gao and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2505.23121},
year = {2025}
}
备注
9 pages, 6 figures