兄弟团队在 WMT 2024:利用 LLM 生成的语境对话进行跨语言图像字幕
计算与语言
2025-11-11 v1 人工智能
摘要
本文描述了我们以兄弟团队名称参赛的系统,用于英语至低资源多模态翻译任务。我们参与了英语至印地语、英语至豪萨语、英语至孟加拉语和英语至马来语语言对的多模态翻译任务。我们提出了一种方法,利用多模态大型语言模型(LLM),具体为 GPT-4o 和 Claude 3.5 Sonnet,来增强跨语言图像字幕,而无需传统的训练或微调。我们的做法利用指令调优提示生成关于裁剪后图像的丰富、语境化的对话,利用其英文字幕作为额外上下文。随后将这些合成对话翻译成目标语言。最后,我们采用加权提示策略,在平衡原始英文字幕与翻译后对话的基础上,生成目标语言中的字幕。该方法实现了具有竞争力的结果,在英语-印地语挑战数据集上获得37.90的BLEU分数,并在英语-豪萨语挑战和评估排行榜中分别获得第一和第二名。我们对250张图像的子集进行了额外实验,探讨了BLEU分数与语义相似性之间在各种加权方案下的权衡。
引用
@article{arxiv.2409.15052,
title = {Brotherhood at WMT 2024: Leveraging LLM-Generated Contextual Conversations for Cross-Lingual Image Captioning},
author = {Siddharth Betala and Ishan Chokshi},
journal= {arXiv preprint arXiv:2409.15052},
year = {2025}
}
备注
Accepted at the Ninth Conference on Machine Translation (WMT24), co-located with EMNLP 2024