中文

面向文化图像描述的检索增强长上下文翻译:Gators团队在AmericasNLP 2026共享任务中的提交

计算与语言 2026-05-21 v1 人工智能 计算机视觉与模式识别

摘要

我们介绍了佛罗里达大学Gators团队在AmericasNLP 2026土著语言文化图像描述共享任务中的提交方案。我们的两阶段流水线首先使用Qwen2.5-VL生成西班牙语中间描述,然后使用Gemini 2.5 Flash通过检索增强的多样本提示生成目标语言描述。在我们的开发集评估中,我们针对Bribri语、Guaraní语和Orizaba Nahuatl语的描述任务,分别比共享任务基线实现了164.1%、131.7%和122.6%的提升,并在测试集评估中为Bribri语和Orizaba Nahuatl语保持了超过150%的提升。我们发现检索高度依赖语言,仅对大型领域内语料库有益,并且合成数据增强约占开发集Guaraní语性能提升的28个chrF++点。我们的提交方案是共享任务的总冠军,在目标语言描述的人工评估中,在五个决赛提交方案中排名第二。

关键词

引用

@article{arxiv.2605.20626,
  title  = {Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task},
  author = {Aashish Dhawan and Christopher Driggers-Ellis and Dzmitry Kasinets and Daisy Zhe Wang and Christan Grant},
  journal= {arXiv preprint arXiv:2605.20626},
  year   = {2026}
}