对齐词语的视觉位置:用于孟加拉语图像描述的交叉注意力引导块对齐与对比性及传输正则化
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
在低资源语言中将视觉-语言模型进行 grounding 仍然具有挑战性,因为它们常常对错误的对象生成流畅的文本。这源于稀缺的配对数据、破坏对齐的翻译枢纽,以及忽略目标语言语义的英语中心化预训练。我们通过一个计算感知的孟加拉语图像描述流水线来解决这一问题,该流水线基于 LaBSE 验证的英-孟加拉语配对和 110k 双语提示合成图像进行训练。冻结的 MaxViT 产生稳定的视觉块,孟加拉语原生的 mBART-50 进行解码,轻量级桥接模块连接两种模态。我们的核心创新在于三损失目标:块对齐损失(PAL)利用解码器交叉注意力对齐真实和合成块描述符,InfoNCE 强制全局真实-合成分离,以及基于 Sinkhorn 的最优传输确保平衡的细粒度块对应。这种 PAL+InfoNCE+OT 的协同效应改善了 grounding,减少了虚假匹配,并在 Flickr30k-1k(BLEU-4 12.29, METEOR 27.98, BERTScore-F1 71.20)和 MSCOCO-1k(BLEU-4 12.00, METEOR 28.14, BERTScore-F1 75.40)上取得了显著提升,优于强 CE 基线,并将真实-合成质心差距缩小了 41%。
引用
@article{arxiv.2509.18369,
title = {Align Where the Words Look: Cross-Attention-Guided Patch Alignment with Contrastive and Transport Regularization for Bengali Captioning},
author = {Riad Ahmed Anonto and Sardar Md. Saffat Zabin and M. Saifur Rahman},
journal= {arXiv preprint arXiv:2509.18369},
year = {2025}
}