ViCLIP-OT:面向越南语言图像-文本检索的首个基础视觉-语言模型
计算机视觉与模式识别
2026-02-27 v1 人工智能
摘要
图像-文本检索已成为智能多媒体系统的基本组件,但大多数现有视觉-语言模型针对高资源语言进行优化,在低资源场景如越南语方面表现不佳。本文引入 ViCLIP-OT,一种专为越南语言图像-文本检索设计的基础视觉-语言模型。该框架将 CLIP 风格的对比学习与基于相似图正规化最优传输 (SIGROT) 的损失函数相结合,以增强全局跨模态一致性,缓解模态间差距问题。在三个越南语基准数据集 (UITOpenViIC、KTVIC 和 Crossmodal-3600) 上进行的广泛实验表明,ViCLIP-OT 在域内和零样本设置下均显著优于 CLIP 和 SigLIP 基线。在 UIT-OpenViIC 上,模型平均 Recall@K 为 67.34%,超出 CLIP 提升 5.75 个百分点。在 Crossmodal-3600 的零样本评估中,ViCLIP-OT 超出 CLIP 11.72 个百分点。嵌入空间分析进一步确认了更好的对齐效果和较小的模态间差距。结果表明,集成 SIGROT 为低资源语言的跨模态检索提供了有效且可扩展的策略,为越南语及其他其他语言环境中智能多媒体检索系统提供了实际意义。
引用
@article{arxiv.2602.22678,
title = {ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport},
author = {Quoc-Khang Tran and Minh-Thien Nguyen and Nguyen-Khang Pham},
journal= {arXiv preprint arXiv:2602.22678},
year = {2026}
}
备注
Preprint submitted to Expert Systems with Applications