面向大语言模型的开放语义超图适配器:置信度增强图像-文本对齐
计算机视觉与模式识别
2025-10-16 v1 多媒体
摘要
文本-图像对齐是多媒体内容理解中的基础性挑战,有效建模跨模态语义对应关系对于通过联合嵌入空间优化显著提升检索系统性能。鉴于文本与图像之间信息熵的内在差异,常规方法往往在这两种模态的相互检索中表现不平衡。为此,我们提出利用大语言模型(LLM)的开放语义知识来填补熵差距,复现人类在此类任务中的对齐能力。我们的置信度增强对齐通过两个步骤实现:1)设计一种不依赖任务域显式知识的新提示模板,用于LLM增强文本模态的歧义描述。通过类比,文本模态相对于视觉模态的信息熵得以增加;2)使用超图适配器用于构建文本和图像模态之间的多边连接,这可以纠正同一固定嵌入空间内同义语义的正负匹配错误,同时通过将减少的维度映射回原始维度来减少由开放语义熵引起的噪声。在Flickr30K和MS-COCO基准测试上进行全面评估,验证了我们开放语义超图适配器(OS-HGAdapter)的优越性,展示了在文本到图像和图像到文本上的跨模态检索提升分别为16.8%和40.1%,在语义对齐任务中建立了新的最先进性能。
引用
@article{arxiv.2510.13131,
title = {OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment},
author = {Rongjun Chen and Chengsi Yao and Jinchang Ren and Xianxian Zeng and Peixian Wang and Jun Yuan and Jiawen Li and Huimin Zhao and Xu Lu},
journal= {arXiv preprint arXiv:2510.13131},
year = {2025}
}