中文

基于翻译泛化的多语言图像描述条件涌现的扩展定律

计算与语言 2025-11-18 v2 机器学习

摘要

跨语言、跨任务迁移面临任务特定数据稀缺的挑战,这一问题随语言支持的增加而加剧,并在视觉语言模型(VLM)中进一步放大。我们研究了编码器-解码器Transformer VLM中的多语言泛化,以实现仅在翻译任务中出现的语言的零样本图像描述。在此设置中,编码器必须学习生成可泛化的、任务感知的潜在视觉表示,并通过插入的交叉注意力层指导解码器。为分析扩展行为,我们基于Florence-2和Gemma-2训练了0.4B到11.2B参数规模的模型,使用不同的计算预算在合成数据集上进行训练。数据集中所有语言都有图像对齐的翻译,但只有一部分包含图像描述。值得注意的是,我们表明即使一种语言仅出现在翻译任务中,也可以通过语言前缀实现描述的出现。我们发现未见任务-语言对的间接学习遵循由模型的多语言性、模型规模和已见训练样本决定的扩展定律。最后,我们证明扩展定律可延伸至下游任务,通过在多模态机器翻译(Multi30K, CoMMuTE)、词汇消歧(CoMMuTE)和图像描述(Multi30K, XM3600, COCO Karpathy)上的微调实现了具有竞争力的性能。

关键词

引用

@article{arxiv.2503.09443,
  title  = {Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation},
  author = {Julian Spravil and Sebastian Houben and Sven Behnke},
  journal= {arXiv preprint arXiv:2503.09443},
  year   = {2025}
}