中文

量化多模态、多语言检索中翻译与本土感知之间的差距

计算机视觉与模式识别 2024-10-10 v2 人工智能

摘要

存在一种不足,即缺乏能够妥善考虑图像标题在不同语言和文化中所反映的感知差异的多语言视觉语言模型。在本工作中,通过一个多模态、多语言检索案例研究,我们量化了现有模型灵活性的不足。我们经验性地展示了在德语本土感知下的标题与被机器翻译或人工翻译从英文到德语的标题之间的性能差距。为弥补这些差距,我们进一步提出并评估了标题增强策略。虽然我们实现了平均召回率的提升 (+1.3),但仍存在差距,这表明社区仍需关注的未来工作领域。

关键词

引用

@article{arxiv.2410.02027,
  title  = {Quantifying the Gaps Between Translation and Native Perception in Training for Multimodal, Multilingual Retrieval},
  author = {Kyle Buettner and Adriana Kovashka},
  journal= {arXiv preprint arXiv:2410.02027},
  year   = {2024}
}

备注

EMNLP 2024 Main - Short