中文

通过原始与增强文本表示上的课程学习提升越南语视觉问答

计算机视觉与模式识别 2025-03-07 v2 机器学习

摘要

视觉问答(VQA)是一种需要跨越文本和视觉输入进行推理的多模态任务,在越南语等低资源语言中尤为具有挑战性,因为语言具有高度变异性且缺乏高质量数据集。传统方法通常严重依赖大量标注数据集、计算代价高昂的流水线以及大型预训练模型,尤其是在越南语VQA领域,这限制了其在这些场景中的适用性。为了解决这些局限性,我们提出了一种结合基于释义的文本增强模块与动态课程学习策略的训练框架。具体而言,增强样本被视为"简单"样本,而原始样本被视为"困难"样本。该框架利用一种机制在训练过程中动态调整简单样本与困难样本的比例,逐步修改同一数据集以提高其难度等级。通过实现对任务复杂度的渐进适应,该方法有助于越南语VQA模型更好地泛化,从而提升整体性能。实验结果表明,在OpenViVQA数据集上取得了持续提升,在ViVQA数据集上呈现混合结果,这凸显了我们的方法在推进越南语VQA方面的潜力与挑战。

关键词

引用

@article{arxiv.2503.03285,
  title  = {Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations},
  author = {Khoi Anh Nguyen and Linh Yen Vu and Thang Dinh Duong and Thuan Nguyen Duong and Huy Thanh Nguyen and Vinh Quang Dinh},
  journal= {arXiv preprint arXiv:2503.03285},
  year   = {2025}
}

备注

10 pages, 3 figures, AAAI-25 Workshop on Document Understanding and Intelligence