中文

将隐式多模态知识蒸馏到大型语言模型中用于零资源对话生成

计算与语言 2025-02-06 v2 多媒体

摘要

将多模态知识整合到大型语言模型(LLMs)中代表了对话生成能力的重大进步。然而,由于缺乏多样、高质量的对话数据集,在零资源场景下有效融入此类知识仍然是一个重大挑战。为此,我们提出了视觉隐式知识蒸馏框架(VIKDF),这是一种创新方法,旨在通过利用隐式多模态知识,增强LLMs在零资源上下文中的丰富对话生成能力。VIKDF包含两个主要阶段:知识蒸馏,使用隐式查询变换器从图像-文本对中提取并编码视觉隐式知识为知识向量;以及知识整合,采用一种新颖的双向变分信息融合技术,将这些蒸馏后的向量无缝整合到LLMs中。这使得LLMs能够生成不仅连贯且引人入胜,而且通过隐式多模态线索展现出对上下文的深刻理解的对话,有效克服了零资源场景的限制。我们在两个对话数据集上的大量实验表明,VIKDF在生成高质量对话方面优于现有的最先进模型。代码可在https://github.com/zhangbo-nlp/VIKDF获取。

关键词

引用

@article{arxiv.2405.10121,
  title  = {Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation},
  author = {Bo Zhang and Hui Ma and Jian Ding and Jian Wang and Bo Xu and Hongfei Lin},
  journal= {arXiv preprint arXiv:2405.10121},
  year   = {2025}
}

备注

Accepted by Information Fusion. The code is available at https://github.com/zhangbo-nlp/VIKDF