中文

面向图像跨文化创译的自动评估

计算与语言 2025-03-24 v3 计算机视觉与模式识别

摘要

超越翻译语音和文本的传统范式,近期人们对自动图像跨文化创译产生了兴趣,以促进视觉内容在不同文化间的本地化。由于缺乏自动评估机制,且先前工作完全依赖人工评估,将其定义为正式的机器学习(ML)问题的尝试受到了阻碍。在本文中,我们旨在通过提出一套受机器翻译(MT)指标启发的自动评估指标来填补这一空白,这些指标分为:a)基于对象的,b)基于嵌入的,以及 c)基于 VLM 的。借鉴翻译研究的理论和现实世界的跨文化创译实践,我们确定了图像跨文化创译的三个关键维度:文化相关性、语义等价性和视觉相似性,并设计了我们的指标以沿这些轴评估系统。我们的结果表明,专有 VLM 最能识别文化相关性和语义等价性,而视觉编码器表征则擅长测量视觉相似性。在 7 个国家进行的元评估表明,我们的指标与人工评分高度一致,平均片段级相关性在 0.55 到 0.87 之间。最后,通过对每个指标优缺点的讨论,我们提供了一个植根于理论基础与实际应用的稳健的自动图像跨文化创译评估框架。我们的代码可在此处找到:https://github.com/simran-khanuja/automatic-eval-img-transcreation。

关键词

引用

@article{arxiv.2412.13717,
  title  = {Towards Automatic Evaluation for Image Transcreation},
  author = {Simran Khanuja and Vivek Iyer and Claire He and Graham Neubig},
  journal= {arXiv preprint arXiv:2412.13717},
  year   = {2025}
}

备注

To be presented at NAACL 2025