面向越南语场景文本图像描述的语言学信息多模态融合:数据集、图框架与音韵注意力
计算机视觉与模式识别
2026-05-01 v1 计算与语言
摘要
场景文本图像描述需要融合三种信息流——视觉特征、OCR检测到的文本和语言学知识——以生成忠实整合图像中可见文本的描述。现有的融合方法将文本视为与语言无关,这对于越南语是行不通的:越南语是一种声调语言,其中变音符号会改变词义,OCR错误普遍存在,且词边界模糊不清。我们认为,越南语场景文本描述需要“语言学信息的多模态融合”,即明确地将语言特定的结构知识纳入融合机制。基于这些见解,我们提出了HSTFG(异构场景文本融合图),这是一个带有学习空间注意力偏置的通用图融合框架,并通过拓扑分析表明跨模态图边对场景文本融合是有害的。基于这一发现,我们设计了PhonoSTFG(音韵场景文本融合图),它专门针对越南语的语言学推理进行了图级融合。为了支持评估,我们引入了ViTextCaps,这是第一个大规模的越南语场景文本描述数据集(15,729张图像,74,970条描述),并进行了全面的语言学分析,显示52.8%的词汇存在变音符号冲突的风险。
引用
@article{arxiv.2604.27712,
title = {Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention},
author = {Nhi Ngoc-Yen Nguyen and Anh-Duc Nguyen and Nghia Hieu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2604.27712},
year = {2026}
}