中文

跨越边界:印度诗歌翻译与图像生成的多模态挑战

计算与语言 2025-11-19 v2 计算机视觉与模式识别

摘要

印度诗歌以其语言的复杂性和深厚的文化共鸣而闻名,拥有跨越数千年的丰富多样的遗产。然而,其多层次的意涵、文化典故和精密的语法结构常常给理解带来挑战,尤其对于非母语者或不熟悉其语境和语言的读者而言。尽管其文化意义重大,但现有的诗歌研究在很大程度上忽视了印度语言诗歌。在本文中,我们提出了翻译与图像生成(TAI)框架,通过适当的提示调优,利用大语言模型(LLMs)和潜在扩散模型。我们的框架通过提升全球受众对文化丰富的印度语言诗歌的可及性,支持联合国可持续发展目标中的优质教育(SDG 4)和减少不平等(SDG 10)。它包括:(1)一个翻译模块,使用优势比偏好对齐算法将形态丰富的诗歌准确翻译成英文;(2)一个图像生成模块,利用语义图捕捉词元、依存关系以及隐喻与其含义之间的语义关系,为印度诗歌创建视觉上有意义的表征。我们全面的实验评估,包括人工评估和定量评估,证明了 TAI Diffusion 在诗歌图像生成任务中的优越性,其性能优于强大的基线模型。为了进一步解决印度语言诗歌资源稀缺的问题,我们引入了形态丰富的印度语言诗歌 MorphoVerse 数据集,该数据集包含来自 21 种低资源印度语言的 1570 首诗。通过弥合诗歌翻译和视觉理解方面的差距,这项工作旨在拓宽可及性并丰富读者的体验。

关键词

引用

@article{arxiv.2511.13689,
  title  = {Crossing Borders: A Multimodal Challenge for Indian Poetry Translation and Image Generation},
  author = {Sofia Jamil and Kotla Sai Charan and Sriparna Saha and Koustava Goswami and Joseph K J},
  journal= {arXiv preprint arXiv:2511.13689},
  year   = {2025}
}