中文

Chitranuvad:适用于多模态翻译的多语言LLM适应

计算与语言 2025-03-03 v1 计算机视觉与模式识别

摘要

本文介绍了我们在亚洲翻译工作坊(WAT2024)英译低资源多模态翻译任务中提交的系统描述。我们提出Chitranuvad,一种有效集成了多语言大语言模型(LLM)和视觉模块的多模态翻译模型。我们的方法使用ViT图像编码器提取视觉表征作为视觉标记嵌入,通过适配器层投影到LLM空间,并以自回归方式生成翻译。我们参与了印度语言(即英译印地语、孟加拉语和马来语)三个轨道的所有任务(图像标注、文本-only和多模态翻译),在挑战数据集上实现了Hindi在所有任务中的SOTA成绩,同时在其他语言上保持竞争力。

关键词

引用

@article{arxiv.2502.20420,
  title  = {Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation},
  author = {Shaharukh Khan and Ayush Tarun and Ali Faraz and Palash Kamble and Vivek Dahiya and Praveen Pokala and Ashish Kulkarni and Chandra Khatri and Abhinav Ravi and Shubham Agarwal},
  journal= {arXiv preprint arXiv:2502.20420},
  year   = {2025}
}