MoKus:利用跨模态知识迁移进行知识感知概念定制
计算机视觉与模式识别
2026-03-16 v1 人工智能
计算与语言
摘要
概念定制通常将稀有词汇绑定到目标概念。然而,这些方法常因预训练数据中稀有词汇不足而导致性能不稳定。此外,这些稀有词汇难以传递目标概念的内在知识。因此,我们提出知识感知概念定制(Knowledge-aware Concept Customization)这一新任务,旨在将多样化的文本知识绑定到目标视觉概念。该任务要求模型识别文本提示中的知识,以实现高保真定制化生成。同时,模型需高效地将所有文本知识绑定到目标概念。为此,我们提出MoKus框架,用于知识感知概念定制。该框架基于一个关键观察:跨模态知识迁移——即修改文本模态中的知识,自然会在生成过程中转化为视觉模态的知识。受此启发,MoKus包含两个阶段:(1) 在视觉概念学习中,我们首先学习锚点表示来存储目标概念的视觉信息。(2) 在文本知识更新中,我们将知识查询的答案更新到锚点表示,从而实现高保真定制化生成。为全面评估我们提出的MoKus在新任务上的表现,我们引入了首个知识感知概念定制基准:KnowCusBench。大量评估表明,MoKus超过了当前最先进的方法。此外,跨模型知识迁移使MoKus能够轻松扩展到其他知识感知应用,如虚拟概念创建和概念擦除。我们还展示了该方法在世界知识基准测试中取得改进的能力。
引用
@article{arxiv.2603.12743,
title = {MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization},
author = {Chenyang Zhu and Hongxiang Li and Xiu Li and Long Chen},
journal= {arXiv preprint arXiv:2603.12743},
year = {2026}
}
备注
Project Page: https://chenyangzhu1.github.io/MoKus/