基于提示学习与语义融合的东巴画作描述生成
计算机视觉与模式识别
2026-03-25 v1
摘要
东巴画作是中国西南地区纳西人人类遗产的精髓,拥有丰富的层次化视觉元素、鲜艳的色彩方案以及显著的民族和地域文化象征,但其自动文本描述因主流描述模型直接应用时的严重领域迁移而基本未被探索。本文提出 PVGF-DPC(基于提示学习与视觉语义-生成融合的东巴画作描述生成),一个集成内容提示模块与新型视觉语义-生成融合损失的编码器-解码器框架,以弥合通用自然图像描述与东巴艺术中特定文化图像之间的差距。MobileNetV2 编码器提取判别性视觉特征,注入 10 层 Transformer 解码器的层归一化中,该解码器使用预训练 BERT 权重初始化;同时,内容提示模块将图像特征向量映射到文化感知标签(如 deity、ritual pattern 或 hell ghost),并构建后置提示以引导解码器生成主题上准确的描述。视觉语义-生成融合损失联合优化提示预测器和描述生成器的交叉熵目标,鼓励模型提取关键文化和视觉线索,生成与输入图像在语义上对齐的描述。我们构建了一个专门的东巴画作描述数据集,包含 9,408 张增强图像,涵盖七个主题类别的文化依据注释。
引用
@article{arxiv.2603.22946,
title = {Caption Generation for Dongba Paintings via Prompt Learning and Semantic Fusion},
author = {Shuangwu Qian and Xiaochan Yuan and Pengfei Liu},
journal= {arXiv preprint arXiv:2603.22946},
year = {2026}
}