UIT-OpenViIC:一种用于评估越南语图像描述的新基准
计算机视觉与模式识别
2023-05-10 v2 计算与语言
摘要
图像描述(image captioning)是2020年代仍令全球研究界感兴趣的视觉-语言任务之一。MS-COCO Caption基准虽发布于2015年,却常被用来评估先进描述模型的性能。近期在MS-COCO Caption数据集上训练的描述模型仅对英语语言模式有良好表现,在越南语境下或用越南语流畅描述图像时表现不佳。为助力越南等低资源研究社区,我们引入了一种越南语图像描述新数据集——开放域越南语图像描述数据集(Open-domain Vietnamese Image Captioning dataset, UIT-OpenViIC)。该数据集包含越南拍摄的复杂场景,由越南人在严格规则与监督下人工标注。本文更详细地介绍了数据集创建过程。初步分析表明,我们的数据集对近期在MS COCO上表现良好的state-of-the-art (SOTA)基于Transformer的基线模型而言具有挑战性。 modest的结果证明UIT-OpenViIC仍有提升空间,可成为越南语研究社区评估其描述模型的标准基准之一。此外,我们提出一种CAMO方法,通过多级编码器输出融合机制有效增强图像表征能力,相较以往描述模型提升了生成描述的质量。
引用
@article{arxiv.2305.04166,
title = {UIT-OpenViIC: A Novel Benchmark for Evaluating Image Captioning in Vietnamese},
author = {Doanh C. Bui and Nghia Hieu Nguyen and Khang Nguyen},
journal= {arXiv preprint arXiv:2305.04166},
year = {2023}
}
备注
10 pages, 7 figures, submitted to Elsevier